中文

揭示大语言模型中反思的潜在方向

机器学习 2025-12-12 v2

摘要

反思,即大语言模型(LLMs)评估和修正自身推理的能力,已被广泛用于提升复杂推理任务上的性能。然而,大多数先前工作侧重于设计反思性提示策略或强化学习目标,而对反思的内在机制探索不足。在本文中,我们通过模型激活中的潜在方向这一视角来研究反思。我们提出了一种基于激活操控的方法,用于表征具有不同反思意图的指令:无反思、内在反思和触发反思。通过在这些反思层次之间构建操控向量,我们证明:(1) 可以系统地识别新的反思诱导指令,(2) 可以通过激活干预直接增强或抑制反思行为,(3) 抑制反思比激发反思容易得多。在 GSM8k-adv 和 Cruxeval-o-adv 上使用 Qwen2.5-3B 和 Gemma3-4B-IT 进行的实验揭示了反思层次之间的明显分层,且操控干预证实了反思的可控性。我们的发现同时揭示了机遇(例如增强反思的防御)和风险(例如在越狱攻击中对抗性地抑制反思)。本工作为理解 LLMs 中的反思性推理开辟了一条机制理解的路径。

关键词

引用

@article{arxiv.2508.16989,
  title  = {Unveiling the Latent Directions of Reflection in Large Language Models},
  author = {Fu-Chieh Chang and Yu-Ting Lee and Pei-Yuan Wu},
  journal= {arXiv preprint arXiv:2508.16989},
  year   = {2025}
}