中文

LLM内在自我纠正:基于机制解释性的可解释提示方法

计算与语言 2026-02-12 v3 人工智能 机器学习

摘要

内在自我纠正在语言模型中表现为:模型仅通过提示即可自行修正其输出,无需外部反馈或参数更新。虽然这一方法在 diverse 任务中提升了性能,但其机制仍不明确。我们表明,内在自我纠正通过沿可解释的潜在方向引导隐藏表征来实现,这一结论基于对齐分析和激活干预的结果。为实现此目标,我们通过分析提示导致的表征迁移来理解内在自我纠正。同时,我们构建包含对比样本的可解释潜在方向,并通过激活添加验证这些方向的因果效应。对六个开源LLM进行评估,结果表明,在文本去暴力化和文本暴力化情境下,提示导致的表征迁移与来自对比对的潜在方向一致。在去暴力化中,迁移方向与非暴力方向一致;在暴力化中,迁移方向与暴力方向一致。这些发现表明,表征引导是内在自我纠正的机制驱动因素。我们的分析表明,理解模型内部结构为分析提示驱动的LLM行为提供了直接途径。

关键词

引用

@article{arxiv.2505.11924,
  title  = {Intrinsic Self-Correction in LLMs: Towards Explainable Prompting via Mechanistic Interpretability},
  author = {Yu-Ting Lee and Fu-Chieh Chang and Yu-En Shu and Hui-Ying Shih and Pei-Yuan Wu},
  journal= {arXiv preprint arXiv:2505.11924},
  year   = {2026}
}