使用下一句预测测试跨语言文本理解能力
代数拓扑
2025-10-30 v1 组合数学
摘要
虽然大型语言模型在大规模数据集上进行训练,但这种数据严重偏向于英语。它们的卓越性能反映的是真正的能力,还是仅仅源于这种数据优势?为此,我们在数据稀缺的语言环境中进行测试。基于Agarwal等人(2025)先前工作中使用的下一句预测(NSP)作为测试方法,我们构建了一个大规模基准,为英语(高资源语言)、斯瓦希利语(中等资源语言)和豪萨语(低资源语言)各准备10,000个问题。随后,我们测试了包括GPT-4 Turbo、Gemini 1.5 Flash和LLaMA 3 70B在内的多个顶尖模型,看看它们的性能如何。结果描绘了语言资源水平影响结果的清晰图景。虽然所有模型在英语中都表现出色,但在斯瓦希利语和豪萨语中的准确率会下降,LLaMA 3的表现最为糟糕。当我们引入链式思考(CoT)提示后,故事变得更加有趣。对于挣扎的LLaMA 3,CoT发挥了有用的指导作用,显著提升了其准确率。然而,对于更强大的GPT-4和Gemini来说,同样的技术反而常常适得其反,导致在跨语言情境下出现“过度思考”,损害其结果。这揭示了链式思考并非万能解方;其有效性高度依赖于模型的基线能力以及特定任务的情境。我们的框架揭示了LLM的弱点,突显了CoT在跨语言NSP性能中的帮助或干扰情况,以及其决策影响因素。
引用
@article{arxiv.2510.25186,
title = {Revisiting the Nandakumar-Ramana Rao Conjecture},
author = {Surojit Ghosh and Ankit Kumar},
journal= {arXiv preprint arXiv:2510.25186},
year = {2025}
}
备注
Comments are welcome