中文

多尺度 Vision Transformer 邂逅二分匹配以实现高效单阶段动作定位

计算机视觉与模式识别 2024-05-24 v2

摘要

动作定位是一个结合检测和识别任务的挑战性难题,而这些任务通常被分开处理。最先进的方法依赖于预先在高分辨率下计算的现成边界框检测,并提出仅专注于分类任务的 Transformer 模型。这种两阶段解决方案对于实时部署来说是禁止的。另一方面,单阶段方法通过让网络的一部分(通常是骨干网络)承担大部分工作负载来同时针对这两个任务,从而以性能换取速度。这些方法基于添加一个带有可学习查询的 DETR 头,在经过交叉注意力和自注意力后,可将其发送到相应的 MLP 以检测人的边界框和动作。然而,类 DETR 架构难以训练且可能产生巨大的复杂度。在本文中,我们观察到**可以直接将二分匹配损失应用于 Vision Transformer 的输出 token**。这产生了一种骨干网络 + MLP 架构,可以在不需要额外编码器 - 解码器头和可学习查询的情况下执行这两个任务。我们表明,经过二分匹配训练以执行这两个任务的单个 MViTv2-S 架构,优于在预计算边界框上使用 RoI align 训练的同一 MViTv2-S。通过精心设计的 token 池化和所提出的训练流程,我们的二分匹配 Vision Transformer 模型**BMViT**在 AVA2.2 数据集上相比两阶段 MViTv2-S 对应模型实现了 +3 mAP 的提升。代码地址:\href{https://github.com/IoannaNti/BMViT}{https://github.com/IoannaNti/BMViT}

关键词

引用

@article{arxiv.2312.17686,
  title  = {Multiscale Vision Transformers meet Bipartite Matching for efficient single-stage Action Localization},
  author = {Ioanna Ntinou and Enrique Sanchez and Georgios Tzimiropoulos},
  journal= {arXiv preprint arXiv:2312.17686},
  year   = {2024}
}

备注

CVPR 2024