面向多语言数学推理的双向对齐与自反馈
计算与语言
2026-01-27 v1
摘要
尽管大型语言模型(LLM)展示了惊人的推理能力,但实证表明它们并非如预期的那样在语言上具有普适性,导致在多语言环境下的性能下降,尤其是针对低资源语言。我们将性能下降归因于模型在多语言理解和推理对齐方面的不一致。在此基础上,我们提出了面向多语言数学推理的自反馈双向对齐方法(Pivot-Aligned Self-Feedback Multilingual Reasoning, PASMR),旨在提高 LLM 在多语言数学推理方面的对齐程度。该方法将模型的主要语言指定为枢轴语言。在训练过程中,模型首先将问题翻译成枢轴语言以促进更好的推理模式对齐。随后,目标语言中的推理过程由枢轴语言的推理答案进行监督,从而建立一种无需依赖外部正确答案或奖励模型的跨语言自反馈机制。大量实验结果表明,我们的方法显著提升了模型对问题的理解能力和推理能力,带来了显著的任务改进。
引用
@article{arxiv.2601.17671,
title = {Align to the Pivot: Dual Alignment with Self-Feedback for Multilingual Math Reasoning},
author = {Chunxu Zhao and Xin Huang and Xue Han and Shujian Huang and Chao Deng and Junlan Feng},
journal= {arXiv preprint arXiv:2601.17671},
year = {2026}
}
备注
This paper has been accepted by ICASSP 2026