中文

用于通用目标 spotting 的扫视视觉 Transformer

计算机视觉与模式识别 2022-10-18 v1

摘要

本文提出了一种将视觉 Transformer 风格的补丁分类器与扫视局部注意力相组合的新方法。同时提出了一种训练目标模型的新优化范式:网络不被训练为最小化类属概率误差,而是被训练为估计到标注目标质心的归一化距离。该方法将一定程度的平移不变性直接构建进模型中,并允许通过梯度上升进行快速扫视搜索以寻找目标质心。所得到的扫视视觉 Transformer 在人脸上进行了演示。

关键词

引用

@article{arxiv.2210.09220,
  title  = {A Saccaded Visual Transformer for General Object Spotting},
  author = {Willem. T. Pye and David. A. Sinclair},
  journal= {arXiv preprint arXiv:2210.09220},
  year   = {2022}
}

备注

11 pages mostly figure, central idea is to train on distance a patch is form a labelled feature