反事实自问:语言模型中稳定策略优化的反事实自问方法
人工智能
2026-01-06 v1
摘要
最近的工作表明,语言模型可以通过反思、验证、辩论或自生成奖励来自我完善推理过程。然而,大多数现有方法依赖外部批评家、学习奖励模型或集成抽样,增加了复杂度和训练不稳定性。我们提出反事实自问方法,该方法使单个语言模型生成并评估自身推理的反事实批评。该方法产生初始推理轨迹,构建针对潜在失败点的目标性问题,并生成暴露错误假设或无效步骤的替代推理轨迹。这些反事实轨迹提供结构化的相对反馈,可直接用于策略优化,而无需辅助模型。在多个数学推理基准测试中进行实验,表明反事实自问在提高准确率和训练稳定性方面有效,特别是对于较小的模型,使其能够仅使用内部生成的监督实现可扩展的自我完善。
引用
@article{arxiv.2601.00885,
title = {Counterfactual Self-Questioning for Stable Policy Optimization in Language Models},
author = {Mandar Parab},
journal= {arXiv preprint arXiv:2601.00885},
year = {2026}
}