Pourquoi le contenu approuvé par les traducteurs constitue les meilleures données d’entraînement
La course au plus grand ensemble de données dans la traduction par IA a atteint un point de rendements décroissants. Le développement initial de l’apprentissage automatique était basé sur l’extraction du plus grand nombre possible de textes bilingues sur le Web ouvert. Cependant, le passage aux grands modèles de langage (LLM) comme Lara a mis en évidence une réalité cruciale.…