SPARO:面向视觉的鲁棒且组合性Transformer编码的选择性注意力机制
计算机视觉与模式识别
2024-09-17 v2 人工智能
摘要
选择性注意力帮助我们在持续涌入的感官输入中聚焦于任务相关方面。这种感知上的约束使我们能够在干扰下鲁棒地泛化,并泛化到可感知概念的新组合。Transformer在其架构中采用了类似的注意力概念,但基于Transformer骨干的表示学习模型(如CLIP和DINO)往往未能展现出鲁棒性和组合性。我们强调了一个缺失的架构先验:与人类感知不同,Transformer编码不会单独关注单个概念。为此,我们提出了SPARO,一种读出机制,它将编码划分为单独关注的槽位,每个槽位由单个注意力头产生。将SPARO与CLIP结合使用,引入了一个归纳偏置,即视觉和文本模态是共享组合世界的不同视图,具有相同的对应概念。使用SPARO,我们在下游识别、鲁棒性、检索和组合性基准测试上展示了改进(在ImageNet上最高+14%,在SugarCrepe上+4%),以及在DINO的ImageNet最近邻和线性探针上各提升+3%。我们还展示了强大的干预和选择单个SPARO概念的能力,以进一步提高下游任务性能(SugarCrepe从+4%提升到+9%),并利用这种能力研究SPARO表示结构的鲁棒性。最后,我们通过消融实验和所学概念的可视化提供了见解。
引用
@article{arxiv.2404.15721,
title = {SPARO: Selective Attention for Robust and Compositional Transformer Encodings for Vision},
author = {Ankit Vani and Bac Nguyen and Samuel Lavoie and Ranjay Krishna and Aaron Courville},
journal= {arXiv preprint arXiv:2404.15721},
year = {2024}
}
备注
Conference paper at ECCV 2024. 11 pages main, 23 pages total including references and appendix