Action Dubber:通过拐点流实现听觉动作的时间定位
计算机视觉与模式识别
2025-06-17 v1 机器学习
摘要
我们提出了听觉动作时间定位任务,旨在识别听觉运动的空间-时间坐标。与传统任务(如动作识别和时间动作定位)广泛分析视频内容不同,我们的任务聚焦于听觉动作独特的运动学动态。其基于的前提是关键动作由拐点运动驱动;例如,产生声音的碰撞通常涉及运动的突变。为捕捉这一点,我们提出了 TA²Net,一种通过运动的二阶导数估计拐点流以确定碰撞时刻的新架构,且不依赖音频输入。TA²Net 还在训练期间集成了自监督空间定位策略,将对比学习与空间分析相结合。这种双重设计提高了时间定位精度,同时识别视频帧中的声源。为支持该任务,我们引入了一个新的基准数据集 Audible623,该数据集从 Kinetics 和 UCF101 中移除非必要的发声子集而来。大量实验证实了我们的方法在 Audible623 上的有效性,并展示了向其他领域(如重复计数和声源定位)的强泛化能力。代码和数据集可在 https://github.com/WenlongWan/Audible623 获取。
引用
@article{arxiv.2506.13320,
title = {Action Dubber: Timing Audible Actions via Inflectional Flow},
author = {Wenlong Wan and Weiying Zheng and Tianyi Xiang and Guiqing Li and Shengfeng He},
journal= {arXiv preprint arXiv:2506.13320},
year = {2025}
}
备注
Accepted by ICML2025