用于通用目标 spotting 的扫视视觉 Transformer
计算机视觉与模式识别
2022-10-18 v1
摘要
本文提出了一种将视觉 Transformer 风格的补丁分类器与扫视局部注意力相组合的新方法。同时提出了一种训练目标模型的新优化范式:网络不被训练为最小化类属概率误差,而是被训练为估计到标注目标质心的归一化距离。该方法将一定程度的平移不变性直接构建进模型中,并允许通过梯度上升进行快速扫视搜索以寻找目标质心。所得到的扫视视觉 Transformer 在人脸上进行了演示。
引用
@article{arxiv.2210.09220,
title = {A Saccaded Visual Transformer for General Object Spotting},
author = {Willem. T. Pye and David. A. Sinclair},
journal= {arXiv preprint arXiv:2210.09220},
year = {2022}
}
备注
11 pages mostly figure, central idea is to train on distance a patch is form a labelled feature