中文

寻找RELIEF:通过信念工程塑造推理行为而无需推理监督

人工智能 2026-01-21 v1 计算与语言

摘要

大规模推理模型(LRM)在复杂问题解决方面取得了显著成就,但常常出现计算冗余或推理不忠实的问题。当前用于塑造LRM行为的方法通常依赖于强化学习或使用黄金标准推理痕迹的微调,这种方法既计算昂贵又难以扩展。在本文中,我们揭示LRM具有潜在的"推理信念",这些信念内部跟踪其自身推理特征,可通过简单的逻辑探测捕获。基于此洞察,我们提出了一种名为RELIEF的推理信念工程框架,通过与目标信念蓝图对齐模型的自我概念来塑造LRM行为。关键在于,RELIEF完全绕过了对推理痕迹监督的需求。它通过对合成的、自我反思的问答对进行微调来内化所需特征,这些问答肯定了目标信念。大量实验在效率和忠诚性任务上表明,RELIEF在要求较低训练成本的情况下,匹配或优于行为监督和偏好基准方法。进一步分析验证了,转移模型的推理信念有效地塑造了其实际行为。

关键词

引用

@article{arxiv.2601.13752,
  title  = {Finding RELIEF: Shaping Reasoning Behavior without Reasoning Supervision via Belief Engineering},
  author = {Chak Tou Leong and Dingwei Chen and Heming Xia and Qingyu Yin and Sunbowen Lee and Jian Wang and Wenjie Li},
  journal= {arXiv preprint arXiv:2601.13752},
  year   = {2026}
}

备注

Working in progress