CopT: 对比式在策略思考于连续空间
计算与语言
2026-05-20 v1 人工智能
摘要
链式思考(CoT)是从大型语言模型(LLM)中激发推理能力的标准方法。然而,常见的CoT范例将思考视为回答的前提,这可能延迟对合理答案的访问,即使模型在扩展思考前就能识别答案,也会产生不必要的token成本,这种行为称为表现性推理。本文引入CopT,一种重新构建的推理管道,以颠倒通常的思考与回答顺序。CopT首先引导草稿答案,然后在其自身草稿答案的条件下调用后续的策略思考,以进行反思和纠正。为评估草稿答案是否值得信赖,CopT将连续嵌入重新解释为推理时的对比验证器。具体而言,它对比模型在离散token输入和连续嵌入输入下对同一生成token的支持,yielding 一个序列级的逆KL估计器,用于答案可靠性。我们的分析表明,在某些假设下,预期估计等于未解决的潜在状态与发出的答案token之间的互信息,解释了为何它捕获答案相关的不确定性而非潜在状态中任意不确定性。当答案被认为不可靠时,CopT进行进一步的策略思考,其中第二个KL估计器动态控制草稿答案的可见性,既保留有用的部分信息,又减少被不可靠内容误导的风险。在数学、编码和智能体推理任务中,CopT在峰值准确率上提高了最高23%,在相当或更高的准确率下,减少了最高57%的token使用,无需任何额外训练。代码可在 https://github.com/sdc17/CopT 获取。
引用
@article{arxiv.2605.20075,
title = {CopT: Contrastive On-Policy Thinking with Continuous Spaces for General and Agentic Reasoning},
author = {Dachuan Shi and Hanlin Zhu and Xiangchi Yuan and Wanjia Zhao and Kejing Xia and Wen Xiao and Wenke Lee},
journal= {arXiv preprint arXiv:2605.20075},
year = {2026}
}
备注
Code: https://github.com/sdc17/CopT, Website: https://copt-web.github.io/