语言-推理解耦让大语言模型更优异地进行多语言推理
计算与语言
2025-12-12 v2
摘要
多语言推理仍是大语言模型(LLM)面临的重大挑战,性能在高资源语言上表现偏高。借鉴认知神经科学中人类推理功能主要独立于语言处理的观点,我们假设LLM同样编码了可被解耦的推理与语言组件。为评估这一假设,我们通过在推理时对语言特定表示进行消除进行因果干预。实验在10个开源大语言模型上进行,涵盖11种在类型学上多样化的语言,结果显示这种语言特定消除始终能提升多语言推理性能。层级分析进一步确认语言与推理表示在模型各层均可有效解耦,从而提升多语言推理能力,而保持顶层语言特征对于维持语言忠实性至关重要。与监督微调或强化学习等后训练方法相比,我们的训练无关的语言-推理解耦方法在计算开销最小的情况下实现了相当或更好的效果。这些发现为阐明LLM内部多语言推理机制,并为改进跨语言泛化提供一种轻量且可解释的策略。
引用
@article{arxiv.2505.15257,
title = {When Less Language is More: Language-Reasoning Disentanglement Makes LLMs Better Multilingual Reasoners},
author = {Weixiang Zhao and Jiahe Guo and Yang Deng and Tongtong Wu and Wenxuan Zhang and Yulin Hu and Xingyu Sui and Yanyan Zhao and Wanxiang Che and Bing Qin and Tat-Seng Chua and Ting Liu},
journal= {arXiv preprint arXiv:2505.15257},
year = {2025}
}
备注
NeurIPS 2025 Camera-ready