Warum von Übersetzern genehmigte Inhalte die besten Trainingsdaten darstellen
Das Rennen um den größten Datensatz in der KI-Übersetzung hat einen Punkt erreicht, an dem der Nutzen abnimmt. Die anfängliche Entwicklung des maschinellen Lernens konzentrierte sich darauf, so viel zweisprachigen Text wie möglich aus dem offenen Web zu extrahieren. Die Verlagerung hin zu großen Sprachmodellen (Large Language Models, LLMs) wie Lara hat jedoch eine kritische Realität offenbart. Das Volumen ist…