当模型用你的语言推理:控制思维语言以牺牲准确性为代价
计算与语言
2025-12-12 v2
摘要
近期带有思维轨迹的大型推理模型在英语推理任务中表现出色。然而,它们用其他语言进行思考的能力较少被研究。对于现实世界的应用而言,这种能力与答案准确性同样重要,因为只有当推理轨迹以用户自己的语言表达时,用户才可能发现该推理轨迹对监督有用。我们在我们的 XReasoning 基准上全面评估了两个领先的 LRM 家族,发现即使是最先进的模型也经常恢复为英语或产生其他语言的碎片化推理,这揭示了多语言推理方面的巨大差距。强制模型用用户语言进行推理的基于提示的干预措施提高了可读性和监督能力,但降低了答案准确性,暴露了一个重要的权衡。我们进一步表明,仅基于 100 个样本的定向后训练可以缓解这种不匹配,尽管仍存在一些准确性损失。我们的结果突出了当前 LRM 有限的多语言推理能力,并为未来的工作指明了方向。代码和数据可在 https://github.com/Betswish/mCoT-XReasoning 获取。
引用
@article{arxiv.2505.22888,
title = {When Models Reason in Your Language: Controlling Thinking Language Comes at the Cost of Accuracy},
author = {Jirui Qi and Shan Chen and Zidi Xiong and Raquel Fernández and Danielle S. Bitterman and Arianna Bisazza},
journal= {arXiv preprint arXiv:2505.22888},
year = {2025}
}
备注
Accepted at EMNLP 2025 Findings