人工流利度:英语训练与原生训练数据集间的斯瓦希里语AI性能基准测试
计算与语言
2025-09-30 v2 计算机与社会
摘要
随着大型语言模型(LLM)扩展多语言能力,其跨语言性能的公平性仍存在疑问。尽管许多社区有望从AI系统中受益,但英语在训练数据中的主导地位可能会使非英语使用者处于不利地位。为了测试数据差异可能影响模型性能这一假设,本研究比较了两个单语BERT模型:一个完全使用斯瓦希里语数据进行训练和测试,另一个使用可比的英语新闻数据。为了模拟多语言LLM如何通过内部翻译和抽象处理非英语查询,我们将斯瓦希里语新闻数据翻译成英语,并使用英语训练模型进行评估。该方法通过评估将斯瓦希里语输入翻译后在英语模型上评估,与完全使用斯瓦希里语训练和测试模型相比,其性能是更好还是更差,从而隔离了语言一致性与跨语言抽象的影响,以此验证了上述假设。结果证明,尽管翻译质量很高,原生斯瓦希里语训练的模型仍优于斯瓦希里语到英语的翻译模型,前者产生的错误几乎比后者少四倍:分别为0.36%和1.47%。这一差距表明,仅靠翻译无法弥合语言之间的表征差异,且用一种语言训练的模型可能由于内部知识表征的不完善而难以准确解释翻译后的输入,这意味着原生语言训练对于获得可靠结果仍然很重要。在教育和信息语境中,即使是微小的性能差距也可能加剧不平等。未来的研究应侧重于为代表性不足的语言开发更广泛的数据集,并重新关注多语言模型评估,以确保减少全球AI部署对现有数字鸿沟的加剧效应。
引用
@article{arxiv.2509.04516,
title = {Artificially Fluent: Swahili AI Performance Benchmarks Between English-Trained and Natively-Trained Datasets},
author = {Sophie Jaffer and Simeon Sayer},
journal= {arXiv preprint arXiv:2509.04516},
year = {2025}
}
备注
13 Pages, 3 Figures