JoVALE:利用视听与语言上下文检测视频中的人类动作
计算机视觉与模式识别
2025-02-04 v2
摘要
视频动作检测(VAD)需要在视频中对动作实例进行定位和分类,而视频本质上由多种信息源组成,如音频、视觉线索和周围场景上下文。有效地利用这些多模态信息进行 VAD 是一项重大挑战,因为模型必须精确识别与动作相关的线索。在本研究中,我们引入了一种新颖的多模态 VAD 架构,称为联合以动作者为中心的视觉、音频、语言编码器。JoVALE 是首个将音频和视觉特征与源自大容量图像描述模型的场景描述上下文相集成的 VAD 方法。JoVALE 的核心是以动作者为中心的音频、视觉和场景描述信息聚合,从而能够自适应地整合关键特征以识别每个动作者的动作。我们开发了一种基于 Transformer 的架构,即以动作者为中心的多模态融合网络,专门设计用于捕捉动作者与其多模态上下文之间的动态交互。我们在包括 AVA、UCF101-24 和 JHMDB51-21 在内的三个著名 VAD 基准上进行了评估,结果表明结合多模态信息显著提升了性能,在该领域创造了新的 SOTA 性能。
关键词
引用
@article{arxiv.2412.13708,
title = {JoVALE: Detecting Human Actions in Video Using Audiovisual and Language Contexts},
author = {Taein Son and Soo Won Seo and Jisong Kim and Seok Hwan Lee and Jun Won Choi},
journal= {arXiv preprint arXiv:2412.13708},
year = {2025}
}
备注
Accepted to AAAI Conference on Artificial Intelligence 2025, 10 pages, 6 figures