中文

基于 Transformer 的区域感知图像人类动作检索

计算机视觉与模式识别 2024-07-30 v2

摘要

人类动作理解是计算机视觉中的一个基本且具有挑战性的任务。尽管该领域存在大量研究,但大多数工作聚焦于动作识别,而动作检索获得的关注相对较少。本文关注被忽视但重要的基于图像的动作检索任务,即旨在查找与查询图像显示相同动作的图像。我们为该任务建立了基准并设置了重要的基线方法以进行公平比较。我们提出了一个 end-to-end 模型,从三个方面学习丰富的动作表示:锚定人物、情境区域和全局图像。设计了一种新颖的融合 Transformer 模块,用于建模不同特征之间的关系并有效地将其融合为动作表示。在 Stanford-40 和 PASCAL VOC 2012 Action 数据集上的实验表明,所提方法在基于图像的动作检索方面显著优于以前的方法。

关键词

引用

@article{arxiv.2407.09924,
  title  = {Region-aware Image-based Human Action Retrieval with Transformers},
  author = {Hongsong Wang and Jianhua Zhao and Jie Gui},
  journal= {arXiv preprint arXiv:2407.09924},
  year   = {2024}
}