Az emberi történelem egyik legnagyobb lopása lehet az AI-modellekhez való adatgyűjtés a Microsoft egyik vezetője szerint
Raketa
2026-09-21 06:03
A Microsoft és az OpenAI számára különösen kellemetlen, amikor időről időre kiszivárognak belsős információk a pereskedések során felhasznált bírósági dokumentumokból. A két cég csörtéje még mindig tart az amerikai sajtóorgánumok kiadóival szemben, akik csoportos eljárásban vádolják azzal a fejlesztőcégeket, hogy az AI-modellek betanítására szánt cikkeket és híreket szerzői jogot sértő módon gyűjtötték össze.
A The New York Times által vezetett csoportos perben csütörtökön nyilvánosságra hoztak olyan dokumentumokat is, melyekből kiderül, hogy a Microsoft és az OpenAI képviselői többé-kevésbé tisztában voltak a médiapiacra gyakorolt potenciális negatív hatásokkal még a ChatGPT és a Copilot piacra dobása előtt.
A leghevesebb kritikát Brent Hecht, a Microsoft alkalmazott tudományokért felelős igazgatója fogalmazta meg, aki a dokumentumok alapján többször figyelmeztette rá a vezetőket, hogy az AI-modellek betanításához szükséges adatok tömeges kaparása (angol kifejezéssel: scraping) gyakorlatilag egy „példátlan mértékű lopás”, sőt hova tovább, az „emberi történelem legnagyobb munkaerő-lopása” lehet.
Hecht nem értett egyet azzal sem, sőt nevetségesnek tartotta, hogy a Microsoft és az OpenAI szerint a nyilvánosan elérhető hírek és cikkek felhasználása kimerítené a méltányos felhasználás fogalmát.
Egy másik Microsoft-dokumentum szerint ez modell egy végzetes spirált idézhet elő, ami káros lehet a modellek teljesítményére és az internet egészére nézve is.
Az OpenAI berkein belül Nick Turley, a ChatGPT -ért felelős vezető egy belsős üzenetben fogalmazta meg azon véleményét, hogy a kiadók egzisztenciális fenyegetéssel nézhetnek szembe a hírtartalmakon betanított kereskedelmi AI-termékek miatt.
Turley rendkívülinek nevezte, hogy egy végtermék veszélyeztesse alapvető beszállítóinak gazdasági alapjait, és nem is lehet másként, mint beismerő vallomásként értelmezni ezt a mondatát:
„éppen ezt a helyzetet teremtettük meg nagy nyelvi modellekkel foglalkozó üzletágunk számára a tartalomellátási lánc tekintetében”
– olvasható a kiszivárogtatott dokumentumban.
A pereskedésre kész hírszolgáltatók szerint rengeteg meggyőző bizonyítékot sikerült már összegyűjteni, és ha sikerül igazolniuk, hogy a chatbotok a saját piacaikon váltják ki őket, miközben szó szerint köpködik ki az ő cikkeik részleteit, az érvénytelenítheti a Microsoft és az OpenAI „méltányos felhasználásra” (fair use) vonatkozó érveit.
(Forrás: Ars Technica . Fotó: Unsplash)