TIM:用于视听动作识别的时间间隔机
计算机视觉与模式识别
2024-04-10 v2
摘要
长视频中多样的动作产生了丰富的视听信号。近期的研究表明,音频和视频这两种模态表现出不同的事件时间跨度与不同的标签。我们通过显式建模音频和视觉事件的时间跨度,来解决长视频中两种模态之间的相互作用。我们提出了时间间隔机(TIM),其中特定模态的时间间隔作为输入长视频的 Transformer 编码器的查询。随后,编码器关注指定的时间间隔以及两种模态中的周围上下文,以识别正在进行的动作。我们在三个长视听视频数据集上测试了 TIM:EPIC-KITCHENS、Perception Test 和 AVE,报告了识别任务的 SOTA。在 EPIC-KITCHENS 上,我们以 2.9% 的 top-1 动作识别准确率超越了利用 LLM 和更大规模预训练的先前 SOTA。此外,我们展示了 TIM 可以适应动作检测任务,使用密集的多尺度间隔查询,在 EPIC-KITCHENS-100 的大多数指标上优于 SOTA,并在 Perception Test 上表现出强劲的性能。我们的消融实验表明,整合两种模态并建模其时间间隔在实现这一性能中发挥了关键作用。代码和模型见:https://github.com/JacobChalk/TIM
引用
@article{arxiv.2404.05559,
title = {TIM: A Time Interval Machine for Audio-Visual Action Recognition},
author = {Jacob Chalk and Jaesung Huh and Evangelos Kazakos and Andrew Zisserman and Dima Damen},
journal= {arXiv preprint arXiv:2404.05559},
year = {2024}
}
备注
Accepted to CVPR 2024. Project Webpage: https://jacobchalk.github.io/TIM-Project