学习面向对象的注意力机制
计算机视觉与模式识别
2025-04-14 v1
摘要
我们提出了一种对视觉 Transformer(ViT)训练的改进方案,使其能够在注意力计算过程中显式建模对象。通过为选定注意力层添加一个新分支来计算我们称之为面向对象的注意力(OFA)损失的辅助损失来实现。我们限制注意力仅集中在属于同一对象类别的图像块上,这使得 ViT 能够通过聚焦于对象内部的块而非背景块,更好地理解构图(或整体)对象形状。我们提出的归纳偏置轻松集成到 Transformer 的注意力框架中,因为仅在选定注意力层上添加辅助损失。此外,我们的方法在推理阶段没有额外开销。我们还实验了多尺度遮蔽,以进一步提高 OFA 模型的性能,并为后续自监督学习提供了可行路径。我们的实验结果表明,带有 OFA 的 ViT 在分类任务上取得更好的结果,能够更强地对离群分布(OOD)和对抗性损坏图像表现出更强的泛化能力,以及学习基于对象形状的表示而非依赖纹理等不良关联。对于我们的 OOD 场景,我们使用 COCO 数据集和稳定扩散填充生成了一个新数据集,计划与社区共享。
引用
@article{arxiv.2504.08166,
title = {Learning Object Focused Attention},
author = {Vivek Trivedy and Amani Almalki and Longin Jan Latecki},
journal= {arXiv preprint arXiv:2504.08166},
year = {2025}
}