Transformer Attention Bottlenecks 启用用户干预与调试:面向视觉语言模型
计算机视觉与模式识别
2025-07-16 v4
摘要
多头自注意力(MHSA)是 Transformer 架构的关键组件,这种架构在语言和视觉领域广受欢迎。虽然多个注意力头直观地允许对同一输入进行不同的并行处理,但它们也掩盖了每个输入块对模型输出的归因。我们提出一种新型单头 Transformer Attention Bottleneck(TAB)层,置于传统 MHSA 架构之后,用作注意力瓶颈以实现可解释性和干预。与标准自注意力不同,TAB 将所有注意力总和限制在 范围内,即当注意力总和为 0 时,视觉信息不会进一步传递到网络中,视觉语言模型(VLM)将默认生成与图像无关的通用响应。为展示 TAB 的优势,我们训练 VLMs 进行图像差异描述。我们的方法在三个数据集上在描述生成方面表现与基线 VLM 相当,但瓶颈在局部化变化和识别无变化情况方面优于基线。TAB 是首个实现用户通过编辑注意力进行调试的架构,常能使 VLM 生成符合预期的输出。
引用
@article{arxiv.2412.18675,
title = {TAB: Transformer Attention Bottlenecks enable User Intervention and Debugging in Vision-Language Models},
author = {Pooyan Rahmanzadehgervi and Hung Huy Nguyen and Rosanne Liu and Long Mai and Anh Totti Nguyen},
journal= {arXiv preprint arXiv:2412.18675},
year = {2025}
}