中文

基于分析-综合的自上而下视觉注意

计算机视觉与模式识别 2023-03-27 v2

摘要

当前的注意算法(如自注意力)是刺激驱动的,会高亮图像中所有显著物体。然而,诸如人类等智能体常基于手头高层任务引导其注意,仅聚焦于任务相关物体。这种任务引导的自上而下注意能力提供了任务自适应表征,并助模型泛化至各类任务。本文从经典的视觉分析-综合(Analysis-by-Synthesis, AbS)视角考量自上而下注意。已有工作指出视觉注意与稀疏重构之间的功能等价性;我们展示了一个优化类似稀疏重构目标并受目标导向自上而下信号调制的 AbS 视觉系统,可自然模拟自上而下注意。我们进一步提出分析-综合视觉 Transformer(AbSViT),其为一种自上而下调制的 ViT 模型,以变分方式近似 AbS,并实现可控的自上而下注意。在实际应用中,AbSViT 在语言引导自上而下注意的视觉-语言任务(如 VQA 与零样本检索)上持续优于基线。AbSViT 亦可作为通用骨干网络,提升分类、语义分割及模型鲁棒性方面的性能。

关键词

引用

@article{arxiv.2303.13043,
  title  = {Top-Down Visual Attention from Analysis by Synthesis},
  author = {Baifeng Shi and Trevor Darrell and Xin Wang},
  journal= {arXiv preprint arXiv:2303.13043},
  year   = {2023}
}

备注

CVPR2023 highlight; Project page: https://sites.google.com/view/absvit