TDAF:面向视觉任务的自上而下注意力框架
计算机视觉与模式识别
2020-12-15 v1
摘要
人类注意力机制常以自上而下方式工作,然而在视觉研究中尚未得到充分探索。在此,我们提出自上而下注意力框架(TDAF)以捕获自上而下注意力,其可轻松应用于大多数现有模型。其中设计的递归双向嵌套结构形成了两组正交路径——递归路径与结构路径,分别提取自底向上的空间特征与自上而下的注意力特征。此类空间特征与注意力特征被深度嵌套,因此所提框架以混合的自上而下与自底向上方式工作。经验证据表明,我们的 TDAF 能够捕获有效的分层注意力信息并提升性能。带 TDAF 的 ResNet 在 ImageNet 上取得 2.0% 的提升。对于目标检测,性能较 FCOS 提升 2.7% AP。对于姿态估计,TDAF 将基线提升 1.6%。而对于动作识别,采用 TDAF 的 3D-ResNet 取得 1.7% 的准确率提升。
引用
@article{arxiv.2012.07248,
title = {TDAF: Top-Down Attention Framework for Vision Tasks},
author = {Bo Pang and Yizhuo Li and Jiefeng Li and Muchen Li and Hanwen Cao and Cewu Lu},
journal= {arXiv preprint arXiv:2012.07248},
year = {2020}
}
备注
Conference paper in AAAI 2021