中文

使用下一句预测测试大语言模型的跨语言文本理解

计算与语言 2025-10-30 v1

摘要

虽然大型语言模型在海量数据集上进行训练,但这些数据严重偏向英语。它们令人印象深刻的表现是反映了真实能力还是仅仅反映了这种数据优势?为了找出答案,我们在一个它们无法依赖数据丰富性的环境中测试了它们:低资源语言。基于先前Agarwal等人(2025)使用下一句预测(NSP)作为测试的工作,我们创建了一个大规模基准,分别为英语(高资源语言)、斯瓦希里语(中资源语言)和豪萨语(低资源语言)各设置了10,000个问题。然后,我们测试了几个顶级模型,包括GPT-4 Turbo、Gemini 1.5 Flash和LLaMA 3 70B,以观察它们的性能表现。结果清晰地描绘了语言资源水平如何影响结果。虽然所有模型在英语方面都表现出色,但它们的准确率在斯瓦希里语中下降,在豪萨语中急剧下降,其中LLaMA 3的表现最差。当我们引入思维链(CoT)提示时,情况变得更加有趣。对于表现不佳的LLaMA 3,CoT起到了有益的指导作用,显著提高了其准确性。然而,对于能力更强的GPT-4和Gemini,同样的技术常常适得其反,导致一种“过度思考”,在跨语言环境中损害了它们的结果。这揭示了思维链并非万能解决方案;其有效性在很大程度上取决于模型的基线能力和任务的具体背景。我们的框架指出了LLM的弱点,突出了CoT何时帮助或阻碍跨语言NSP性能,以及影响其决策的因素。

关键词

引用

@article{arxiv.2510.25187,
  title  = {Testing Cross-Lingual Text Comprehension In LLMs Using Next Sentence Prediction},
  author = {Ritesh Sunil Chavan and Jack Mostow},
  journal= {arXiv preprint arXiv:2510.25187},
  year   = {2025}
}