面向行为自我觉察的最小条件与机制化条件
计算与语言
2025-11-11 v2 人工智能
机器学习
摘要
近期的研究表明,大语言模型可以表现出行为自我觉察:即能够在没有明确监督的情况下准确描述或预测其自身学习的行为。这种能力因安全问题而引发关注,例如模型可能更好地隐瞒其在评估期间的真实能力。我们尝试刻画这种自我觉察出现的最小条件,以及其通过何种机制实现。在针对指令微调的大语言模型上进行受控微调实验(使用低秩适配器 LoRA)后,我们发现:(1) 仅通过一个秩为1的 LoRA 适配器即可可靠地诱导自我觉察;(2) 所学的自我觉察行为可在激活空间中由单个引导向量大体捕获,几乎恢复了大部分微调的行为效果;(3) 自我觉察是非普适且领域局部化的,不同任务中存在独立的表征。综上,这些发现表明,行为自我觉察作为一种可被轻易诱导和调制的领域特定线性特征而出现。
引用
@article{arxiv.2511.04875,
title = {Minimal and Mechanistic Conditions for Behavioral Self-Awareness in LLMs},
author = {Matthew Bozoukov and Matthew Nguyen and Shubkarman Singh and Bart Bussmann and Patrick Leask},
journal= {arXiv preprint arXiv:2511.04875},
year = {2025}
}