揭示大语言模型中反思的潜在方向
机器学习
2025-12-12 v2
摘要
反思,即大语言模型(LLMs)评估和修正自身推理的能力,已被广泛用于提升复杂推理任务上的性能。然而,大多数先前工作侧重于设计反思性提示策略或强化学习目标,而对反思的内在机制探索不足。在本文中,我们通过模型激活中的潜在方向这一视角来研究反思。我们提出了一种基于激活操控的方法,用于表征具有不同反思意图的指令:无反思、内在反思和触发反思。通过在这些反思层次之间构建操控向量,我们证明:(1) 可以系统地识别新的反思诱导指令,(2) 可以通过激活干预直接增强或抑制反思行为,(3) 抑制反思比激发反思容易得多。在 GSM8k-adv 和 Cruxeval-o-adv 上使用 Qwen2.5-3B 和 Gemma3-4B-IT 进行的实验揭示了反思层次之间的明显分层,且操控干预证实了反思的可控性。我们的发现同时揭示了机遇(例如增强反思的防御)和风险(例如在越狱攻击中对抗性地抑制反思)。本工作为理解 LLMs 中的反思性推理开辟了一条机制理解的路径。
引用
@article{arxiv.2508.16989,
title = {Unveiling the Latent Directions of Reflection in Large Language Models},
author = {Fu-Chieh Chang and Yu-Ting Lee and Pei-Yuan Wu},
journal= {arXiv preprint arXiv:2508.16989},
year = {2025}
}