中文

用于动作检测的整体交互 Transformer 网络

计算机视觉与模式识别 2022-11-21 v2 人工智能

摘要

动作关乎我们如何与环境交互,包括其他人、物体以及自身。本文提出一种新颖的多模态整体交互 Transformer 网络(HIT),其利用了被普遍忽视但对多数人动作至关重要的手与姿态信息。所提“HIT”网络是一个包含 RGB 流与姿态流的综合性双模态框架。每条流分别建模人、物体与手的交互。在每个子网络内,引入模态内聚合模块(IMA)以选择性合并个体交互单元。随后使用注意力融合机制(AFM)将各模态所得特征粘合。最后,我们从时间上下文提取线索,利用缓存记忆更好地分类所发生动作。我们的方法在 J-HMDB、UCF101-24 与 MultiSports 数据集上显著优于先前方法,并在 AVA 上取得具竞争力的结果。代码将发布于 https://github.com/joslefaure/HIT。

关键词

引用

@article{arxiv.2210.12686,
  title  = {Holistic Interaction Transformer Network for Action Detection},
  author = {Gueter Josmy Faure and Min-Hung Chen and Shang-Hong Lai},
  journal= {arXiv preprint arXiv:2210.12686},
  year   = {2022}
}

备注

Accepted for WACV 2023. Code: https://github.com/joslefaure/HIT