测试时自反思生成
计算与语言
2025-10-06 v1
摘要
大型语言模型(LLM)越来越多地通过长思维链解决复杂推理任务,但其前向自回归生成过程是脆弱的;早期标记错误可能级联扩散,这迫切需要自我反思机制。然而,现有的自我反思要么对完整草稿进行修订,要么通过昂贵的训练学习自我纠正,两者本质上都是反应性的且效率低下。为解决这一问题,我们提出测试时自反思生成(SRGen),一个轻量级测试时框架,在不确定点之前进行反思。在标记生成过程中,SRGen 利用动态熵阈值识别高不确定性标记。对于每个识别出的标记,它训练一个特定的校正向量,充分利用已生成的上下文进行自我反思生成以校正标记概率分布。通过回顾性分析部分输出,这种自我反思使决策更加可信,从而显著降低高不确定性点的错误概率。在具有挑战性的数学推理基准和多样化 LLM 上评估,SRGen 能够持续增强模型推理:单次通过质量的提升也转化为更强的自一致性投票。尤其在 AIME2024 上使用 DeepSeek-R1-Distill-Qwen-7B 时,SRGen 在 Pass@1 上取得 +12.0% 的绝对提升,在 Cons@5 上取得 +13.3% 的绝对提升。此外,我们的发现将 SRGen 定位为一种即插即用方法,将反思融入生成过程以实现可靠的 LLM 推理,在有限开销下取得一致提升,并与训练时(如 RLHF)和测试时(如 SLOT)技术具有广泛组合性。
引用
@article{arxiv.2510.02919,
title = {Self-Reflective Generation at Test Time},
author = {Jian Mu and Qixin Zhang and Zhiyong Wang and Menglin Yang and Shuang Qiu and Chengwei Qin and Zhongxiang Dai and Yao Shu},
journal= {arXiv preprint arXiv:2510.02919},
year = {2025}
}
备注
24 pages, 8 figures