中文

何时思考,何时表达:面向LLM推理的披露策略学习

计算与语言 2026-05-07 v2

摘要

在单流自回归接口中,相同的token既更新模型状态,又构成不可逆的公共承诺。这种耦合导致沉默成本:额外推理延迟了首个任务相关内容,而过早的简单流式输出则风险偏早的承诺会偏导后续生成。在Side-by-Side(SxS)交错推理中,我们将披露时机作为可控决策纳入标准自回归生成。SxS在同一上下文中交错进行部分披露与持续私有推理,但仅在其受支持的证据驱动时才发布内容。为在不激励填充物的前提下学习此类节奏,我们通过匹配答案前缀与支撑推理前缀构建披露对齐的交错轨迹,然后采用SFT学习双动作语义,再用RL在新格式下恢复推理性能。在两个Qwen3架构/规模(MoE Qwen3-30B-A3B、密集型Qwen3-4B)和both in-domain(AIME25)与out-of-domain(GPQA-Diamond)基准测试中,SxS在以token级代理如inter-update等待的Pareto权衡下提高了准确率。

关键词

引用

@article{arxiv.2605.03314,
  title  = {When to Think, When to Speak: Learning Disclosure Policies for LLM Reasoning},
  author = {Jiaqi Wei and Xuehang Guo and Pengfei Yu and Xiang Zhang and Wanli Ouyang and Siqi Sun and Qingyun Wang and Chenyu You},
  journal= {arXiv preprint arXiv:2605.03314},
  year   = {2026}
}

备注

Accepted by ICML'2026