中文

面向人类的 Transformer 用于域自适应动作识别

计算机视觉与模式识别 2024-07-16 v1

摘要

我们研究了动作识别的域迁移任务,即域自适应动作识别,该任务旨在有效地将动作识别能力从标记充足的源域迁移到标记自由的目标域。由于动作是由人类执行的,因此在跨域识别动作时,挖掘人类线索至关重要。然而,现有方法容易丢失人类线索,更倾向于利用与动作关联的非人类背景之间的相关性进行识别,对于与动作无关的背景会降低目标域内的识别性能。为克服此问题,我们聚焦于为域自适应动作识别探寻人类导向的动作线索, our 思路是考察两种人类导向的动作线索,即人类线索和人类-背景交互线索。基于此, 我们提出的 Human-Centric Transformer (HCTransformer) 采用解耦的人类导向学习范式,显式地在域异构视频特征学习中专注于人类导向的动作线索。 HCTransformer 首先通过人类编码器进行人类感知的时间建模,以避免在域不变视频特征学习中丢失人类线索。随后, 采用类似 Transformer 的架构, HCTransformer 通过背景编码器利用与域不变和动作相关的背景, 并进一步建模人类与动作相关背景之间的域不变交互。 我们在三个基准数据集上进行了大量实验, 即 UCF-HMDB、Kinetics-NecDrone 和 EPIC-Kitchens-UDA, 并通过 state-of-the-art 的性能证明了我们提出的 HCTransformer 的有效性。

关键词

引用

@article{arxiv.2407.10860,
  title  = {Human-Centric Transformer for Domain Adaptive Action Recognition},
  author = {Kun-Yu Lin and Jiaming Zhou and Wei-Shi Zheng},
  journal= {arXiv preprint arXiv:2407.10860},
  year   = {2024}
}

备注

Accepted by TPAMI