中文

RefAtomNet++:基于语义检索的多轨迹 Mamba 用于提升指向性原子视频动作识别

计算机视觉与模式识别 2025-10-21 v1 多媒体 机器人学 图像与视频处理

摘要

指向性原子视频动作识别(RAVAR)旨在在自然语言描述的条件下识别特定感兴趣人员的细粒度、原子级动作。与常规动作识别和检测任务不同,RAVAR 强调精确的语言引导动作理解,这在复杂多人场景中尤为关键。本文扩展了先前提出的 RefAVA 数据集至 RefAVA++,该数据集总计包含超过 290 万帧和 75.1 万个标注人员。我们使用来自多个相关领域的基线进行基准测试,包括原子动作局部化、视频问答和文本-视频检索,以及我们先前的模型 RefAtomNet。尽管 RefAtomNet 通过引入 agent attention 来突出显示显著特征,但其在对齐和检索跨模态信息方面的能力仍有限,导致在定位目标人员和预测细粒度动作方面性能次优。为克服上述局限性,我们引入 RefAtomNet++,一种新型框架,通过在部分关键词、场景属性和整体句子水平上结合多层次语义对齐跨注意力机制和多轨迹 Mamba 模型来推进跨模态 token 聚合。具体而言,在部分关键词和场景属性水平上,构建扫描轨迹,通过动态选择每个时间步最近的视觉空间 token。此外,我们设计了多层次语义对齐跨注意力策略,实现更有效地聚合不同语义层次之间的空间和时间 token。实验表明,RefAtomNet++ 建立了新的最先进成绩。该数据集和代码已发布于 https://github.com/KPeng9510/refAVA2。

关键词

引用

@article{arxiv.2510.16444,
  title  = {RefAtomNet++: Advancing Referring Atomic Video Action Recognition using Semantic Retrieval based Multi-Trajectory Mamba},
  author = {Kunyu Peng and Di Wen and Jia Fu and Jiamin Wu and Kailun Yang and Junwei Zheng and Ruiping Liu and Yufan Chen and Yuqian Fu and Danda Pani Paudel and Luc Van Gool and Rainer Stiefelhagen},
  journal= {arXiv preprint arXiv:2510.16444},
  year   = {2025}
}

备注

Extended version of ECCV 2024 paper arXiv:2407.01872. The dataset and code are released at https://github.com/KPeng9510/refAVA2