中文

面向任务导向信息删除的注意力机制实验研究

机器学习 2026-01-29 v3 人工智能 计算与语言

摘要

注意力机制是一种新兴的基于现代语言模型(LMs)的少样本学习范式,但其内在机制尚不清晰。本文从信息删除的新视角入手探讨其机制。具体而言,我们证明在零样本场景中,LMs将查询编码为非选择性表示于隐藏状态中,这些隐藏状态包含所有可能任务的信息,导致输出任意化,几乎得不到准确性。同时,我们发现通过低秩滤波器从隐藏状态中选择性移除特定信息,即可有效引导LMs聚焦于目标任务。基于上述发现,我们通过在精心设计的指标上测量隐藏状态,观察到少样本 ICL 实际上模拟了此类任务导向信息删除过程, selectively 移除了来自 entangled 非选择性表示中冗余的信息,从而提高基于演示的输出质量,这构成了 ICL 内在机制的关键因素。此外,我们识别了诱导删除操作的关键注意力头,称为去噪头(Denoising Heads),通过消除信息删除操作的推理实验,ICL准确性显著下降,尤其在正确标签缺失于少样本演示时下降更为显著,既确认了信息删除机制的关键作用,也证实了去噪头的重要性。

关键词

引用

@article{arxiv.2509.21012,
  title  = {Mechanism of Task-oriented Information Removal in In-context Learning},
  author = {Hakaze Cho and Haolin Yang and Gouki Minegishi and Naoya Inoue},
  journal= {arXiv preprint arXiv:2509.21012},
  year   = {2026}
}

备注

87 pages, 90 figures, 7 tables, ICLR 2026 Camera-ready