为低资源语言构建人工智能:如何从零开始进行数据整理

在本文中

数字革命并未同时到达每一种语言。 英语、西班牙语和普通话等少数高资源语言在用于训练当今最大模型的数据集中占据主导地位。 与此同时,成千上万的其他语言社区仍处于“数字沙漠”状态。 这种差距不仅仅是技术上的疏忽。 这是全球包容性、经济机会和文化遗产保护的障碍。 要弥合这一鸿沟,不仅需要更快的处理能力,还需要进行根本性转变,转向以数据为中心的策划,优先考虑人类的专业知识和语境,而不是原始的网络抓取。

关键要点

  • 质量高于数量。 在低资源环境中,构建包容性 AI 模型取决于精准、人工主导的策划,而不是通用 LLM 所使用的庞大、未经过滤的数据集。
  • 战略性人机协同。 利用 LALITA 等框架,并通过 T-Rank 等平台招募母语语义注释员,可确保数据集在语言上具有复杂性,在文化上具有准确性。
  • 可衡量的影响。 本地化 AI 的成功应以编辑时间 (TTE) 来衡量,确保机器翻译输出达到真正赋能人类专业人员的标准。

数字语言差距:为什么许多文化被 AI 遗漏

大语言模型 (LLM) 的包容性取决于它们所摄取的数据。 多年来,行业一直依靠对公共互联网的大规模抓取来为生成式 AI 提供训练数据。 然而,这种方法本质上偏向于数字足迹较大的语言,而忽略了全球使用但网络上代表性不足的 7,000 多种语言。 通用 LLM 通常会尝试翻译或生成这些服务不足语言的内容。 当它们这样做时,往往会陷入“模型崩溃”或幻觉。 它们缺乏理解文化细微差别和语法复杂性所需的基础语境。

从数据价值到数据量:AI 策划的转变

过去十年对“数据量”的痴迷正在达到一个自然极限。 随着人工智能研究人员面临高质量人类文本的短缺,重点已转向数据本身的价值。 对于资源较少的语言,这种转变至关重要。 我们不再需要数万亿个令牌来构建高性能模型。 相反,我们需要精准的“黄金数据集”。 这些精心构建的数据集以高精度反映了语言的真实含义和结构。 这种以数据为中心的 AI 方法侧重于提高训练数据的质量,而不仅仅是架构的复杂性。

为什么通用大语言模型在服务不足的社区中会失败

通用 LLM 通常难以处理资源较少的语言,因为它们依赖于统计模式,而非语义理解。 以克丘亚语或沃洛夫语等语言为例,这些语言的数字文本很少。 通用模型可能会尝试使用相关高资源语言的模式来“填补空白”。 这会导致翻译在语法上有误或在文化上不敏感。 为了构建真正有效的人工智能,我们必须超越这些笼统的做法。 我们需要实施专门构建的解决方案,如 Lara。 这种语境感知型 LLM 优先考虑整个文档的语境和语义准确性。

在低资源环境中收集原始文本和语音的策略

为低资源语言构建 AI 的第一个障碍是缺乏基础语料库。 当文本不存在于数字格式时,组织必须直接从源头获取。 这涉及从各种环境中收集原始数据,从数字化的当地报纸和历史档案到当代语音模式,无所不包。 对于非营利组织和研究机构来说,这一阶段是将口头传统和纸质文档转换为机器可读的格式,这些格式可以作为新模型的支柱。

通过社区主导的采集克服“数字沙漠”

在数字化程度有限的环境中,社区参与是获取数据的最有效方式。 通过与当地大学、文化中心和非政府组织合作,研究人员可以收集多样化的语言输入,反映语言的实际使用情况。 这可能包括录制口头对话、收集短信或将社区新闻通讯数字化。 这些努力确保训练数据不仅仅是对西方概念的翻译,而是对当地生活和思想的反映。

构建基础语料库:从口头传统到移动文本

许多低资源语言主要是口语,或以零散的数字形式存在,例如社交媒体帖子或短信。 构建基础语料库需要将这些不同的来源整合为结构化的格式。 这个过程通常从高质量的语音数据转录开始,然后是对不同拼写和方言的规范化。 组织应聚焦于强调管理和清理的“AI 数据”服务。 这确保了即使是小型数据集也足够鲁棒,能够在不引入重大偏差或干扰的情况下训练基础模型。

为稀有和区域方言招募母语注释者

数据整理并非纯粹的自动化过程;它需要人类的深度监督。 为了确保人工智能模型真正理解区域方言的细微差别,研究人员必须招募同时也是领域专家的母语人士。 这些语义注释员不仅仅是检查拼写错误,还要验证单词和概念(称为实体)之间的关系是否得到准确呈现。

T-Rank 和母语语义注释员的选拔

寻找稀有语言的合适专业人士需要先进的匹配技术。 Translated 使用 T-Rank,这是一个由 AI 驱动的系统,能够根据表现、领域专业知识和实时可工作状态,从我们逾 50 万名经过严格筛选的语言专家的国际人才网络中,对专业语言人才进行排名。 这使得组织能够为任何特定方言找到最合适的母语人士,确保用于注释的数据达到尽可能高的质量。 无论任务涉及法律术语还是医学概念,合适的注释员都能确保模型的输出在语境上准确无误。

“向左移动”方法:让语言专家参与数据设计阶段

在传统的工作流程中,人工审核通常发生在管道的最后阶段。 为了针对低资源语言构建更好的 AI,我们主张采用“向左移动”方法。 这意味着在数据设计阶段,也就是在第一个模型训练之前,就让母语注释者参与进来。 专家定义实体架构,并创建完美注释数据的“黄金数据集”。 这为模型提供了清晰、高质量的路线图。 因此,这显著降低了在开发周期后期出错的风险。

使用平行句提取来构建翻译数据集

平行语料库由两种不同语言的匹配句子组成,是训练翻译模型的主要动力。 在低资源场景中,这些数据集很少能大量提供。 研究人员必须使用先进的提取技术来查找并对齐翻译句对。 他们从不同的来源获取这些数据,例如多语种政府网站或国际新闻报道。

使用 LALITA 框架实现高复杂度比对

词汇和语言信息文本分析 (LALITA) 框架是平行数据整理领域中的重大突破。 LALITA 并不试图对齐每个句子,而是识别并优先处理具有高语言复杂性和技术丰富性的句子。 通过专注于这些高价值句段,组织可以构建有效的翻译模型,所需数据比传统方法少 50%。 这种效率对于低资源语言至关重要,因为对于这些语言,每个高质量的翻译对都是稀缺资源。

大规模提取含义:LASER 嵌入和实体映射

为了对齐结构截然不同的不同语言的句子,我们使用多语言嵌入,如 LASER (Language-Agnostic SEntence Representations)。 这些数学模型在多维空间中表示句子的含义,使我们能够根据语义意图而不是逐字逐句的重叠来找到匹配项。 这种技术与实体映射相结合。 它确保文章的核心概念保持一致,无论目标语言如何。

包容性 AI 模型如何推动全球数字公平

针对低资源语言构建 AI 的终极目标是实现数字公平。 这意味着,在这个世界里,每个人都能用自己的语言理解他人,也被他人理解。 非营利组织和公共部门分析师需要获得高质量的本地化 AI。 这使他们能够提供基本服务,例如健康信息和法律支持。 它能够触及以前因语言障碍而被孤立的社区。

超越准确性:用编辑时间 (TTE) 衡量影响

在 AI 翻译领域,准确性只是问题的一部分。 为了真正衡量模型的价值,我们着眼于编辑时间 (TTE)。 该指标表示专业语言工作者为将机器翻译的句段编辑到人工翻译质量所需的平均时间。 使用精心策划的高质量数据进行训练的模型将始终产生较低的 TTE 分数,这意味着专业译者可以更快、更有效地工作。 在 Translated,TTE 是我们衡量在翻译“奇点”概念方面进展的主要基准。 这是机器输出与人工翻译变得无法区分的时刻。

总结:以数据为中心的 AI 是通往通用理解的桥梁

针对低资源语言构建 AI 是对人类沟通未来的战略投资。 通过摆脱“越大越好”的理念,采用以数据为中心、人类与 AI 共生的方法,我们可以创建尊重语言多样性并为全球社区赋能的模型。 为低资源语言进行高质量的数据整理不仅仅是一项技术任务,更是打造更具包容性、更加透明的数字世界的基石。

常见问题

这些常见问题阐明了在服务不足的语言环境中构建高质量 AI 数据集的技术和运营要求。

在 AI 的背景下,什么是低资源语言?

低资源语言是指在用于机器学习的数字数据集中缺乏显著存在的语言。 这通常包括有数百万使用者但数字化书籍、网站或公共档案很少的语言。 在 AI 开发中,挑战在于标准的网络抓取方法无法提供足够的高质量文本来训练基础模型。

LALITA 框架如何改进数据管理?

LALITA(词汇和语言信息文本分析)是一个优化训练数据选择的框架。 它不关注原始数据量,而是使用语言算法来识别富含技术术语和复杂语法结构的句段。 这使得组织能够使用小得多但信息量更大的数据集来训练高效模型。

语义注释员的作用是什么?

语义注释员是母语专家,负责验证单词与其所代表的概念(实体)之间的关系。 与传统的校对人员不同,语义注释人员确保 Lara 理解句子背后的上下文和意图。 这对于防止在数字语境稀缺的语言中出现“模型崩溃”至关重要。

为什么使用编辑时间 (TTE) 而不是标准准确性分数?

TTE(编辑时间)衡量完善 AI 输出结果所需的实际人力投入。 虽然 BLEU 等传统分数衡量的是统计相似性,但 TTE 直接衡量的是真实专业环境中的效率和质量。 对于资源较少的语言,较低的 TTE 表明 Lara 为人工翻译人员提供了真正有帮助的基础。

能否为没有数字文本的语言构建 AI?

可以,但这个过程需要从原始数据采集开始。 这通常涉及通过语音转文本技术或扫描纸质文档来实现口头传统的数字化。 通过从头开始创建基础语料库,组织可以为以前被排除在数字经济之外的语言社区构建第一代 AI 工具。

在本文中