中文

对抗视角:利用注意力层生成用于评估的对抗样本

计算与语言 2026-01-01 v1 人工智能 机器学习

摘要

机制可解释性的最新进展表明,中间注意力层编码了词元级假设,这些假设被迭代地细化以趋近最终输出。在本工作中,我们利用这一特性直接从注意力层词元分布生成对抗样本。与基于提示或基于梯度的攻击不同,我们的方法利用模型内部的词元预测,产生既合理又与模型自身生成过程内部一致的扰动。我们评估了从中间层提取的词元是否可以作为下游评估任务的有效对抗扰动。我们使用 ArgQuality 数据集对论证质量评估进行了实验,以 LLaMA-3.1-Instruct-8B 同时作为生成器和评估器。我们的结果表明,基于注意力的对抗样本导致评估性能的可测量下降,同时在语义上与原始输入保持相似。然而,我们也观察到,从某些层和词元位置提取的替换可能会引入语法退化,限制了它们的实际有效性。总体而言,我们的发现突出了使用中间层表示作为对抗样本的原则性来源以对基于 LLM 的评估流水线进行压力测试的前景和当前局限性。

关键词

引用

@article{arxiv.2512.23837,
  title  = {Adversarial Lens: Exploiting Attention Layers to Generate Adversarial Examples for Evaluation},
  author = {Kaustubh Dhole},
  journal= {arXiv preprint arXiv:2512.23837},
  year   = {2026}
}