Perché i contenuti approvati dai traduttori costituiscono i migliori dati di addestramento
La corsa al più grande set di dati nella traduzione basata sull’IA ha raggiunto un punto in cui i rendimenti decrescono. Lo sviluppo iniziale dell’apprendimento automatico si è concentrato sull’estrazione della maggior quantità possibile di testo bilingue dal web aperto. Tuttavia, il passaggio ai modelli linguistici di grandi dimensioni (LLM) come Lara ha messo in luce una realtà critica. Il…