跨语言坍缩:语言中心基础模型如何塑造大型语言模型的推理
计算与语言
2026-02-24 v3 人工智能
摘要
强化学习与可验证奖励(RLVR)是通过长链思维(CoT)激发大型语言模型(LLM)强大推理能力的关键方法。在 RLVR 训练期间,我们形式化并系统性地研究了这样一种经验现象:多语言模型的 CoT 在被提示使用另一种语言时,会回归到其主导预训练语言(例如英语)。我们称之为跨语言坍缩。由于长 CoT 方案放大了对语言先验的暴露,在最大化推理深度与保持目标语言忠诚度之间的权衡尚未得到充分 characterization。为了检视这种权衡,我们在翻译版本的数学数据集上训练 LLM(这些数据集常用于激发长 CoT 推理),并在训练期间跟踪任务准确率和推理链的语言一致性。我们的实验得出三个发现:(i) 在 RLVR 下,LLM 的 CoT 在推理性能提升的同时系统性地趋向主导语言;(ii) 英语中心的先验、长 CoT GRPO 优化、任务难度和高熵解码共同放大了这种趋势,模式超越数学领域;(iii) 通过语言一致性奖励、解码时控制或更平衡的 backbone 等干预措施偏好目标语言痕迹可减轻坍缩,但揭示了持久的性能-忠诚度权衡。
引用
@article{arxiv.2506.05850,
title = {Cross-lingual Collapse: How Language-Centric Foundation Models Shape Reasoning in Large Language Models},
author = {Cheonbok Park and Jeonghoon Kim and Joosung Lee and Sanghwan Bae and Jaegul Choo and Kang Min Yoo},
journal= {arXiv preprint arXiv:2506.05850},
year = {2026}
}
备注
Preprint