通过问题空间映射解耦理解与推理:面向小规模模型的推理方法
计算与语言
2025-12-16 v2 人工智能
摘要
尽管近期在大语言模型(LLMs)推理能力方面取得了进展,但提高小型语言模型(SLMs,例如最多 15 亿参数)的推理能力仍具有挑战性。一个关键障碍在于自然语言的复杂性和多样性:本质上等价的问题常常以多种表面形式出现,往往被冗余或分散的细节所掩盖。这给 SLMs 带来了双重负担:它们首先必须从复杂的语言输入中提取核心问题,然后基于此进行推理。由此产生的庞大且嘈杂的问题空间阻碍了优化,尤其是对于容量有限的模型而言。为此,我们提出一种新的框架,通过将自然语言问题映射到标准化问题空间来解耦理解与推理——该空间是一个语义上简化而又具表达力的领域。这使 SLMs 能够专注于标准化输入上的推理,摆脱语言变异的干扰。在该框架内,我们引入 DURIT(Decoupled Understanding from Reasoning via Iterative Training,即通过迭代训练解耦理解与推理),该方法依据以下三个步骤迭代:(1)通过强化学习将自然语言问题映射;(2)通过自蒸馈对齐推理轨迹;(3)在问题空间中训练推理策略。映射器与推理器在整个过程中以交替方式进行共训练。实验表明,DURIT 在提高 SLMs 在基本及非基本数学和逻辑推理任务上的性能方面具有显著效果。除提升推理能力外,DURIT 还提高了推理的鲁棒性,验证了解耦理解与推理是增强 SLMs 有效性的有效策略。
引用
@article{arxiv.2508.10019,
title = {Decoupling Understanding from Reasoning via Problem Space Mapping for Small-Scale Model Reasoning},
author = {Li Wang and Changhao Zhang and Zengqi Xiu and Kai Lu and Xin Yu and Kui Zhang and Wenjun Wu},
journal= {arXiv preprint arXiv:2508.10019},
year = {2025}
}