在翻译中发现:像“翻译后评估”一样简单地衡量多语言 LLM 的一致性
计算与语言
2025-05-29 v1
摘要
大语言模型(LLM)能够对英语查询提供详尽且令人印象深刻的回复。然而,在用其他语言回复相同查询时,它们真的能保持一致吗?评估 LLM 多语言性能的流行方法需要收集成本高昂的标注数据集。此外,对于开放式生成等可能存在多个正确答案的任务,其评估并非易事。相反,我们提出评估模型在不同语言下响应的可预测性。在本工作中,我们提出了一个基于简单的“翻译后评估”策略来评估 LLM 跨语言一致性的框架。我们从信息一致性和共情一致性这两个维度实例化了该评估框架。我们的结果揭示了流行的 LLM 在三十种语言的响应中存在明显的不一致性,在某些语系和文字系统中表现出严重的性能缺陷,凸显了其多语言能力的关键弱点。这些发现表明需要进行在多个维度上保持一致的跨语言评估。我们邀请从业者使用我们的框架进行未来的多语言 LLM 基准测试。
引用
@article{arxiv.2505.21999,
title = {Found in Translation: Measuring Multilingual LLM Consistency as Simple as Translate then Evaluate},
author = {Ashim Gupta and Maitrey Mehta and Zhichao Xu and Vivek Srikumar},
journal= {arXiv preprint arXiv:2505.21999},
year = {2025}
}