中文

R-Capsule:压缩高层计划以实现高效大语言模型推理

计算与语言 2025-09-30 v2 人工智能

摘要

思维链(CoT)提示帮助大语言模型(LLM)通过引发显式的逐步推理来处理复杂推理。然而,CoT 的冗长性增加了延迟和内存使用,并可能在长链中传播早期错误。我们提出了推理胶囊(R-Capsule),一个旨在结合隐式推理的效率与显式 CoT 的透明性的框架。核心思想是将高层计划压缩为一组学习到的隐式标记(推理胶囊),同时保持执行步骤轻量或显式。这种混合方法受信息瓶颈(IB)原理启发,我们鼓励胶囊在任务上近似最小但充分。最小性通过低容量瓶颈来鼓励,有助于提高效率。充分性通过双重目标来鼓励:用于答案准确性的主任务损失和用于计划重建的辅助损失,后者鼓励胶囊忠实表示原始文本计划。重建目标有助于锚定隐式空间,从而改善可解释性并减少无信息捷径的使用。我们的框架在效率、准确性和可解释性之间取得平衡,从而在保持或提高复杂基准测试准确性的同时减少推理的可见标记足迹。我们的代码可在以下地址获取:https://anonymous.4open.science/r/Reasoning-Capsule-7BE0

关键词

引用

@article{arxiv.2509.22131,
  title  = {R-Capsule: Compressing High-Level Plans for Efficient Large Language Model Reasoning},
  author = {Hongyu Shan and Mingyang Song and Chang Dai and Di Liang and Han Chen},
  journal= {arXiv preprint arXiv:2509.22131},
  year   = {2025}
}