中文

大规模推理模型中的路径漂移:第一人称承诺如何违背安全机制

计算与语言 2025-10-14 v1

摘要

随着大型语言模型(LLM)越来越多地用于复杂推理任务,长链思维(Long Chain-of-Thought, Long-CoT) prompting 已成为结构化推理的关键范式。尽管早期通过对齐技术(如 RLHF)实现了初步安全保障,但我们发现了一个尚未充分探讨的漏洞:长链思维模型的推理轨迹可能偏离对齐路径,导致生成内容违反安全约束。我们称之为路径漂移(Path Drift)。通过实证分析,我们发现了三种引发路径漂移的行为触发因素:(1)第一人称承诺导致目标导向的推理,从而延迟拒绝信号;(2)伦理蒸发,表面层的免责声明绕过对齐检查点;(3)条件链级联,层层线索逐渐引导模型走向不安全的完成。基于这些洞见,我们引入了一个三阶段的路径漂移诱导框架,包括认知负荷放大、自我角色激活和条件链劫持。每个阶段独立降低拒绝率,而其组合进一步放大效应。为缓解这些风险,我们提出了一种基于角色归因纠正和元认知反思(反思安全线索)的路径级防御策略。我们的发现凸显了在长形式推理中超越词元级对齐的轨迹级对齐监督的必要性。

关键词

引用

@article{arxiv.2510.10013,
  title  = {Path Drift in Large Reasoning Models:How First-Person Commitments Override Safety},
  author = {Yuyi Huang and Runzhe Zhan and Lidia S. Chao and Ailin Tao and Derek F. Wong},
  journal= {arXiv preprint arXiv:2510.10013},
  year   = {2025}
}