中文

反事实自问:语言模型中稳定策略优化的反事实自问方法

人工智能 2026-01-06 v1

摘要

最近的工作表明,语言模型可以通过反思、验证、辩论或自生成奖励来自我完善推理过程。然而,大多数现有方法依赖外部批评家、学习奖励模型或集成抽样,增加了复杂度和训练不稳定性。我们提出反事实自问方法,该方法使单个语言模型生成并评估自身推理的反事实批评。该方法产生初始推理轨迹,构建针对潜在失败点的目标性问题,并生成暴露错误假设或无效步骤的替代推理轨迹。这些反事实轨迹提供结构化的相对反馈,可直接用于策略优化,而无需辅助模型。在多个数学推理基准测试中进行实验,表明反事实自问在提高准确率和训练稳定性方面有效,特别是对于较小的模型,使其能够仅使用内部生成的监督实现可扩展的自我完善。

关键词

引用

@article{arxiv.2601.00885,
  title  = {Counterfactual Self-Questioning for Stable Policy Optimization in Language Models},
  author = {Mandar Parab},
  journal= {arXiv preprint arXiv:2601.00885},
  year   = {2026}
}