中文

通过多智能体强化学习实现链条思维的自压缩

人工智能 2026-01-30 v1 计算与语言

摘要

冗余推理导致的推理开销削弱了交互体验,并严重瓶颈了大型推理模型的部署。现有基于强化学习(RL)的解决方案通过将长度惩罚与结果奖励耦合来解决此问题。这种简单的奖励权重难以在简洁性和准确性之间取得平衡,因为强制简洁可能会损害关键推理逻辑。本文通过提出一种多智能体RL框架来 selectively �惩罚冗余模块,同时保留关键推理逻辑来克服这一限制。我们的框架称为自压缩通过 MARL(SCMA),通过两种专门的智能体实现冗余检测和评估:一个**分段智能体**用于将推理过程分解为逻辑模块,一个**评分智能体**用于量化每个模块的重要性。分段智能体和评分智能体协同定义了基于重要性加权的长度惩罚,以激励**推理智能体**在部署期间优先考虑关键逻辑而不会引入推理开销。跨模型规模的经验评估表明,SCMA 可将响应长度缩短 11.1%至 39.0%,同时将准确率提升 4.33%至 10.02%。此外,消融研究和定性分析表明,MARL 框架内的协同优化促进了新兴行为,产生更强大的 LRM,与纯粹的 RL 范式相比效果更佳。

关键词

引用

@article{arxiv.2601.21919,
  title  = {Self-Compression of Chain-of-Thought via Multi-Agent Reinforcement Learning},
  author = {Yiqun Chen and Jinyuan Feng and Wei Yang and Meizhi Zhong and Zhengliang Shi and Rui Li and Xiaochi Wei and Yan Gao and Yi Wu and Yao Hu and Zhiqiang Pu and Jiaxin Mao},
  journal= {arXiv preprint arXiv:2601.21919},
  year   = {2026}
}