语言的重要性:多语言输入和推理路径对大型推理模型的影响
人工智能
2026-02-06 v2
摘要
大型推理模型(LRM)在广泛的推理任务中展现了惊人的性能,但关于它们在多语言环境下的内部推理过程的了解仍很少。我们首先提出了一个关键问题:{\it 这些模型在解决不同语言的问题时,推理于何种语言?}我们的发现表明,尽管进行了多语言训练,LRM在测试时倾向于默认使用高资源语言(如英语)进行推理, regardless of the input language.当被限制仅用与输入相同语言进行推理时,模型性能会下降,尤其是对低资源语言。相比之下,using high-resource languages generally preserves performance.我们在广泛的推理任务(MMMLU, MATH-500)和非推理基准(CulturalBench, LMSYS-toxic)上进行了广泛评估,显示语言选择的效果因任务类型而异:输入语言推理会降低推理任务的性能,但有助于文化任务,而安全评估则表现出语言特异性。通过揭示LRM中的语言偏见,我们的工作为开发更公平的模型、服务于不同语言背景的用户铺平了关键路径。
引用
@article{arxiv.2505.17406,
title = {Robust Answers, Fragile Logic: Probing the Decoupling Hypothesis in LLM Reasoning},
author = {Enyi Jiang and Changming Xu and Nischay Singh and Tian Qiu and Gagandeep Singh},
journal= {arXiv preprint arXiv:2505.17406},
year = {2026}
}