指代原子视频动作识别
计算机视觉与模式识别
2024-07-12 v2 机器人学
图像与视频处理
摘要
我们提出了一种新任务,称为指代原子视频动作识别(Referring Atomic Video Action Recognition, RAVAR),旨在基于文本描述和该人员的视频数据,识别特定个人的原子动作。该任务不同于传统动作识别和定位,后者针对所有在场个体进行预测。相反,我们聚焦于受文本指导,识别特定个体的正确原子动作。为探索此任务,我们构建了RefAVA数据集,包含36,630个实例,包含对个体的文本描述的手动标注。为建立强有力的初始基准,我们实现并验证了来自多个领域的基线方法,如原子动作定位、视频问答和文本-视频检索。由于这些现有方法在RAVAR上表现不佳,我们引入RefAtomNet——一种专为RAVAR独特挑战而设计的、基于跨流注意力的方法:解释针对目标个体的文本指代表达,利用此引用引导空间定位,收集针对指代人员的原子动作预测。关键要素包括:(1)连接视频、文本以及新建位置-语义流的多流体系结构,(2)跨流主体注意力融合和主体token融合,这些机制放大这些流中最相关的信息,并在RAVAR上 consistently 超越标准注意力融合。广泛的实验表明,RefAtomNet及其构建模块对识别所描述个体的动作效果显著。数据集和代码将公开发布于 https://github.com/KPeng9510/RAVAR。
引用
@article{arxiv.2407.01872,
title = {Referring Atomic Video Action Recognition},
author = {Kunyu Peng and Jia Fu and Kailun Yang and Di Wen and Yufan Chen and Ruiping Liu and Junwei Zheng and Jiaming Zhang and M. Saquib Sarfraz and Rainer Stiefelhagen and Alina Roitberg},
journal= {arXiv preprint arXiv:2407.01872},
year = {2024}
}
备注
Accepted to ECCV 2024. The dataset and code will be made publicly available at https://github.com/KPeng9510/RAVAR