Chop Chop BERT:通过砍掉 VisualBERT 的注意力头进行视觉问答
计算机视觉与模式识别
2021-05-03 v1
摘要
视觉与语言(VL)预训练在许多相关下游任务上展现出巨大潜力,例如 VL 领域中最受欢迎的问题之一——视觉问答(VQA)。所有这些预训练模型(如 VisualBERT、ViLBERT、LXMERT 和 UNITER)都基于 Transformer 构建,后者将经典注意力机制扩展至多层和多头。为探究这些模型为何及如何在 VQA 上表现如此良好,本文探讨了 Transformer 模型中单个注意力头与层在处理 类不同问题时的作用。具体而言,我们每次从预训练的 VisualBERT 模型中手动移除(砍掉)注意力头(或层),并在不同层级的问题上测试以记录其性能。如结果矩阵有趣的阶梯状所示,实验揭示不同的注意力头与层负责不同的问题类型,较高级层由较高级视觉推理问题激活。基于该观察,我们设计了一个动态砍除模块,可在处理不同问题时于实例级别自动移除 VisualBERT 的注意力头与层。我们的动态砍除模块能将原始模型参数量有效减少 50%,同时在 VQA 任务上仅损害不到 1% 的准确率。
引用
@article{arxiv.2104.14741,
title = {Chop Chop BERT: Visual Question Answering by Chopping VisualBERT's Heads},
author = {Chenyu Gao and Qi Zhu and Peng Wang and Qi Wu},
journal= {arXiv preprint arXiv:2104.14741},
year = {2021}
}
备注
14 pages