中文

通过具有不确定性感知的自适应推理轨迹的强化学习来缓解谄媚行为

人工智能 2025-09-23 v1

摘要

尽管大型语言模型具有卓越的能力,但当前的训练范式无意中助长了谄媚行为,即模型倾向于同意或强化用户提供的信息,即使这些信息在事实上是错误的。为了应对这一挑战,我们引入了 SMART(通过自适应推理轨迹缓解谄媚),它将谄媚重新定义为一个推理优化问题,而非输出对齐问题。SMART 是一个两阶段框架,包括:(1) 不确定性感知的自适应蒙特卡洛树搜索(UA-MCTS),它根据状态级不确定性动态调整模型探索,以收集高质量、多样化的推理轨迹,并同时获得逐步进展和最终结果的奖励;(2) 基于进展的强化学习,它利用收集到的轨迹和奖励信号对模型进行微调,以强化有效的推理模式。通过大量实验,我们表明 SMART 显著减少了谄媚行为,同时在分布外输入上保持了强大的性能,并维持了通用能力。这些结果强调了优化内部推理机制对于构建更真实、更对齐的 AI 助手的重要性。

关键词

引用

@article{arxiv.2509.16742,
  title  = {Sycophancy Mitigation Through Reinforcement Learning with Uncertainty-Aware Adaptive Reasoning Trajectories},
  author = {Mohammad Beigi and Ying Shen and Parshin Shojaee and Qifan Wang and Zichao Wang and Chandan Reddy and Ming Jin and Lifu Huang},
  journal= {arXiv preprint arXiv:2509.16742},
  year   = {2025}
}