Construire une IA pour les langues à faibles ressources : comment sélectionner des données à partir de zéro
La révolution numérique n’est pas arrivée dans toutes les langues en même temps. Une poignée de langues à ressources élevées, telles que l’anglais, l’espagnol et le mandarin, dominent les ensembles de données utilisés pour entraîner les plus grands modèles actuels. Pendant ce temps, des milliers d’autres communautés linguistiques restent dans un état de « désert numérique ». Cet écart n’est pas seulement…