中文

用于部分可观测场景的基于一致性驱动的序列Transformer注意力模型

计算机视觉与模式识别 2022-04-05 v1

摘要

大多数硬注意力模型最初观察完整场景以定位并感知信息丰富的 glimpses,并基于glimpses预测场景的类别标签。然而,在许多应用(例如航空成像)中,由于获取所需的时间和资源有限,观察整个场景并不总是可行的。在本文中,我们提出了一种序列Transformer注意力模型(STAM),它仅部分观察完整图像,并仅基于过去的glimpses预测信息丰富的glimpse位置。我们使用DeiT-distilled设计智能体,并用一步actor-critic算法训练它。此外,为提高分类性能,我们引入了一种新的训练目标,其强制由教师模型从完整图像预测的类别分布与我们的智能体使用glimpses预测的类别分布之间的一致性。当智能体仅感知总图像面积的4%时,在我们的训练目标中加入所提出的一致性损失在ImageNet和fMoW数据集上分别带来3%和8%的准确率提升。此外,我们的智能体在ImageNet和fMoW上分别通过少感知约27%和42%的glimpse像素超越了先前的最先进方法。

关键词

引用

@article{arxiv.2204.00656,
  title  = {Consistency driven Sequential Transformers Attention Model for Partially Observable Scenes},
  author = {Samrudhdhi B. Rangrej and Chetan L. Srinidhi and James J. Clark},
  journal= {arXiv preprint arXiv:2204.00656},
  year   = {2022}
}

备注

Accepted to CVPR 2022