超越内省:通过外部行为反馈强化思考
机器学习
2025-12-01 v3 人工智能
计算与语言
摘要
虽然推理时思考允许大型语言模型 (LLM) 解决复杂问题,但由于模型的概率性特征,尤其在知识边界附近,延长的思考过程可能不可靠或不一致。现有方法通过让模型批判自身推理来进行纠正,但此类自我批判继承了原始输出的偏见,称为内省幻觉。受 ethology 核心方法ological 启发,本文提出一种外部主义三步框架蒸馏-强化-推理 (Distillation-Reinforcement-Reasoning, DRR)。不同于依赖模型的内省,DRR 通过评估其可观察行为来提供纠正性反馈。DRR 首先蒸馏推理者的行为痕迹,然后训练一个轻量级、外部判别模型 (Discriminative Model, DM)。在推理时,该 DM 作为批判者,识别并拒绝可疑的推理步骤。这种外部反馈迫使 LLM 丢弃错误的路径并探索替代方案,从而在不改变基础模型的前提下提升推理质量。多个推理基准测试上的实验表明,我们的方法显著优于 prominent 自我批判方法。凭借轻量级且无需标注的设计,DRR 提供了一个可扩展且可适应的解决方案,用于提高各种 LLM 推理可靠性。
引用
@article{arxiv.2501.01457,
title = {Beyond Introspection: Reinforcing Thinking via Externalist Behavioral Feedback},
author = {Diji Yang and Linda Zeng and Kezhen Chen and Yi Zhang},
journal= {arXiv preprint arXiv:2501.01457},
year = {2025}
}