AI bouwen voor talen met weinig bronnen: hoe u gegevens vanaf nul kunt samenstellen
De digitale revolutie is niet in elke taal tegelijk aangekomen. Een handvol talen met veel bronnen, zoals Engels, Spaans en Mandarijn, domineren de gegevenssets die worden gebruikt om de grootste modellen van vandaag te trainen. Ondertussen blijven duizenden andere taalgemeenschappen in een staat van “digitale woestijn”. Deze kloof is niet alleen een technische vergissing. Het is een belemmering voor wereldwijde…