CyclicReflex:通过循环反思词元调度改进推理模型
计算与语言
2025-06-16 v1
摘要
大型推理模型(LRMs),如 OpenAI 的 o1 和 DeepSeek-R1,利用测试时计算扩展来执行多步推理以解决复杂问题。这种在产生最终答案之前执行的推理过程,通常由提示自我评估反思的特殊节点词元引导。这些转换标记和反思线索被称为“反思词元”(例如,“wait”、“but”、“alternatively”)。在本工作中,我们将反思词元视为一种“资源”,并引入资源分配问题,旨在通过自适应调节反思词元的频率和位置来提高 LRMs 的测试时计算性能。通过实证分析,我们表明过度和不足使用反思词元(分别称为过度反思和反思不足)都会降低模型性能。为了更好地理解这种权衡,我们将反思词元的使用与优化中的学习率调度进行了类比。基于这一洞察,我们提出了循环反思词元调度(称为 CyclicReflex),这是一种免训练的解码策略,通过双向、位置相关的三角波形动态调节反思词元的 logits,且不产生额外的计算成本。在 MATH500、AIME2024/2025、AMC2023、GPQA Diamond 和 LiveCodeBench 上的实验表明,CyclicReflex 在不同模型规模(1.5B-14B)上均能持续提升性能,优于标准解码以及 TIP(thought switching penalty)和 S1 等近期方法。代码可在 https://github.com/OPTML-Group/CyclicReflex 获取。
引用
@article{arxiv.2506.11078,
title = {RoE-FND: A Case-Based Reasoning Approach with Dual Verification for Fake News Detection via LLMs},
author = {Yuzhou Yang and Yangming Zhou and Zhiying Zhu and Zhenxing Qian and Xinpeng Zhang and Sheng Li},
journal= {arXiv preprint arXiv:2506.11078},
year = {2025}
}