推理通用语言:多语言人工智能的双刃剑
计算与语言
2026-02-10 v3 人工智能
摘要
大规模推理模型(LRM)在数学、科学等问答任务中取得了强大的性能,但其多语言推理能力仍未得到充分探索。当面对非英语问题时,LRM往往会默认使用英语进行推理,这引发了可解释性和处理语言、文化细微差别的担忧。我们系统比较了LRM在英语与问题语言中的推理方式。我们的评估涵盖两个任务:MGSM和GPQA Diamond。除了衡量答案准确率外,我们还分析了推理痕迹中的认知属性。我们发现,英语推理痕迹中这些认知行为的出现频率显著更高,英语推理通常也能获得更高的最终答案准确率,随着任务复杂度的增加,性能差距也随之增大。然而,这种以英语为中心的策略容易出现关键失效模式——在翻译步骤中迷失,导致本可避免的错误。
引用
@article{arxiv.2510.20647,
title = {The Reasoning Lingua Franca: A Double-Edged Sword for Multilingual AI},
author = {Alan Saji and Raj Dabre and Anoop Kunchukuttan and Ratish Puduppully},
journal= {arXiv preprint arXiv:2510.20647},
year = {2026}
}
备注
14 pages, 13 figures, 5 tables