
YouTube-video's als AI-trainingsmateriaal: contentmakers in het nadeel
Het internet biedt te weinig bruikbare teksten voor het trainen van spraak-AI-systemen. OpenAI nam daarom zijn toevlucht tot video's op YouTube. Dit is echter niet toegestaan.
Kunstmatige intelligentie (AI) is op ieders lippen, of beter gezegd op ieders scherm. Ze schrijven teksten, genereren afbeeldingen en video's, componeren liedjes en programmeren. Een AI is echter zo goed als het trainingsmateriaal waartoe hij toegang heeft: hoe meer materiaal, hoe beter. Volgens een verslag in de New York Times heeft het AI-bedrijf OpenAI voor dit doel ook toegang gekregen tot miljoenen uren videomateriaal van het YouTube-platform - hoewel de richtlijnen van YouTube een dergelijke toegang verbieden.
Niet genoeg gegevens voor verdere AI-training
Het is al lang duidelijk dat degenen die weten hoe ze AI moeten gebruiken in de toekomst enorme voordelen zullen behalen. Omgekeerd betekent dit dat degenen die de beste AI ontwikkelen de meest lucratieve marktaandelen zullen verwerven. De grote bedrijven op het gebied van AI voor spraak, waaronder OpenAI, Google en Meta, zijn daarom in een nek-aan-nek race om de beste AI te ontwikkelen.
Hoewel dat ook gebeurt, is niet duidelijk.
Hiervoor is echter een zo groot mogelijke pool van trainingsmateriaal nodig dat door mensen is geproduceerd. AI-bedrijven laten hun algoritmes al door allerlei soorten internetcontent lopen om deze over te dragen aan hun AI-systemen.
Hoogwaardige data
Gegevens van hoge kwaliteit, zoals specialistische artikelen, boeken, Wikipedia-pagina's en andere inhoud die is gemaakt met kwaliteit in gedachten, zijn bijzonder waardevol. Volgens de AI-onderzoeksorganisatie Epoch zou deze content tussen 2024 en 2026 volledig geïndexeerd kunnen zijn. Een ander probleem is dat veel van deze inhoud auteursrechtelijk beschermd is - maar dat weerhoudt AI-ontwikkelaars er niet van om het toch te gebruiken.
YouTube-video's als illegale bron van trainingsgegevens
Om meer gegevens voor zijn spraak-AI te verkrijgen, ontwikkelde OpenAI in 2021 de tool Whisper, die gesproken taal in YouTube-video's kan transcriberen. De resulterende teksten kunnen worden gebruikt als verder trainingsmateriaal voor de spraak-AI. Volgens medewerkers die door de New York Times worden geciteerd, is er ongeveer een miljoen uur aan video's verwerkt in de huidige versie van Chat-GPT. De criteria op basis waarvan deze video's zijn geselecteerd blijven onduidelijk. Vergeleken met de totale afspeeltijd op YouTube is een miljoen uur niet veel: volgens Statista werd er in 2022 elke dag ongeveer 720.000 uur aan nieuwe video's toegevoegd.
Maar zo'n miljoen uur aan video's is niet veel.
Echter, een dergelijke toegang is niet toegestaan: volgens YouTube's gebruiksvoorwaarden is het niet toegestaan om "toegang te krijgen tot de dienst [d.w.z. YouTube] met behulp van geautomatiseerde processen (bijvoorbeeld robots, botnets of scrapers) [...]". De ontwikkelaars van OpenAI hebben dit bewust overtreden, volgens de New York Times. En Google, dat eigenaar is van YouTube, was hiervan op de hoogte.
Hoewel Google zelf in de problemen zit: het heeft ook het potentieel van YouTube video's onderkend en gebruikt ze als trainingsmateriaal. Dit is ook verkeerd, want YouTube bezit niet het auteursrecht van de video's op zijn platform. Dat ligt bij de content creators die video's maken en uploaden. YouTube kan daarom moeilijk protesteren tegen ongeautoriseerde toegang door OpenAI als de AI van moederbedrijf Google zelf illegaal gebruik maakt van de contentmakers.
Klachten van auteursrechthebbenden
De New York Times berichtte niet voor niets over deze nieuwe mogelijke schending van het auteursrecht door AI-bedrijven. Het klaagde OpenAI in december al aan voor onrechtmatig gebruik van zijn eigen artikelen https://www.rosepartner.de/blog/urheberrechtsverletzung-durch-ki-training.html. De geüploade content kan door de AI worden gerepliceerd en dus ook bijdragen aan het commerciële succes van OpenAI zonder financiële compensatie of vermelding van auteurschap.
Het gebruik van beschermde werken wordt een probleem voor artiesten, auteurs en andere contentmakers. Volgens de New York Times heeft het Amerikaanse Copyright Office al meer dan 10.000 klachten ontvangen. Een eerste collectieve rechtszaak door artiesten is echter al verworpen door een rechter.
Op dit moment is er nog geen sprake van een rechtszaak.
Er zijn op dit moment geen wettelijke regels die het gebruik van AI met betrekking tot auteursrecht specificeren.
Voelt zich net zo thuis voor de spelcomputer als in de hangmat in de tuin. Houdt onder andere van het Romeinse Rijk, containerschepen en sciencefictionboeken. Bovenal speurt hij naar news uit de IT-sector en slimme dingen.
Van de nieuwe iPhone tot de wederopstanding van de mode uit de jaren 80. De redactie categoriseert.
Alles tonen