大语言模型如何压缩其自身的链式思维?一种token复杂度方法
计算与语言
2025-04-02 v2 人工智能
摘要
链式思维提示方法已成为启用大语言模型(LLMs)解决复杂推理任务的强大技术。然而,这些推理链可能冗长,引发效率问题。为此,近期研究通过简单提示策略(如“简洁呈现”)以缩短响应长度。本文进行了关于推理长度与模型性能之间关系的首次系统性研究,涵盖多样化的压缩指令(如“使用10个单词或更少”或“删除所有标点”)。我们发现,推理长度与准确率之间存在一种普遍的权衡,这种权衡在即使差异巨大的推理链之间也持续存在。我们表明,这种权衡源于问题层面的尖锐阈值行为:每个任务都有一个内在的“token复杂度”——成功解决问题所需的最小token数。我们展示了token复杂度如何使我们能够计算信息论意义上的准确率-压缩权衡的上限,并发现基于提示的压缩策略远非达到这些理论限制。这表明仍有显著的改进空间,而我们的框架为帮助研究人员评估推理效率的进展提供了基准。我们的工作还强调了自适应压缩的重要性——即为更容易的问题提供更短的响应——我们表明token复杂度是衡量这一能力的有用工具。
引用
@article{arxiv.2503.01141,
title = {How Well do LLMs Compress Their Own Chain-of-Thought? A Token Complexity Approach},
author = {Ayeong Lee and Ethan Che and Tianyi Peng},
journal= {arXiv preprint arXiv:2503.01141},
year = {2025}
}