通过翻译-推理集成训练实现自我提升的多语言长程推理
计算与语言
2026-02-06 v1
摘要
长程推理模型在多语言环境中常常表现不佳:它们倾向于为非英文问题进行英文推理;当受限于使用问题语言进行推理时,准确率会大幅下降。这种困境源于多语言问题理解和多语言推理能力的有限。为解决这两个问题,我们提出TRIT(Translation-Reasoning Integrated Training),即一种集成翻译训练于多语言推理中的自我提升框架。该方法无需外部反馈或额外的多语言数据,即可同时提升多语言问题理解和响应生成能力。在MMATH数据集上,我们的方法相较于多个基线方法平均提升了7个百分点,显著改善了答案正确性和语言一致性。进一步分析表明,集成翻译训练通过超过10个百分点的提升实现了跨语言问题对齐,并提升了数学问题和通用领域文本的翻译质量,在FLORES-200数据集上COMET分数提升最高可达8.4分。
引用
@article{arxiv.2602.05940,
title = {Self-Improving Multilingual Long Reasoning via Translation-Reasoning Integrated Training},
author = {Junxiao Liu and Zhijun Wang and Yixiao Li and Zhejian Lai and Liqian Huang and Xin Huang and Xue Han and Junlan Feng and Shujian Huang},
journal= {arXiv preprint arXiv:2602.05940},
year = {2026}
}
备注
16 pages, 11 figures