SoundingActions: 从带有旁白的自我中心视频中学习动作的声音
计算机视觉与模式识别
2024-04-09 v1 多媒体
声音
音频与语音处理
摘要
我们提出了一种新颖的自监督嵌入方法,用于从带有旁白的自然自我中心视频中学习动作的声音。现有方法依赖于具有已知视听对应关系的精选数据,而我们提出的多模态对比一致性编码(MC3)嵌入在所有模态对均一致时增强音频、语言和视觉之间的关联,并在任意一对模态不一致时削弱这些关联。我们表明,我们的方法能够成功地从自我中心视频中发现人类长尾动作的声音,在两个数据集(Ego4D 和 EPIC-Sounds)和多个跨模态任务上优于一系列最新的多模态嵌入技术。
引用
@article{arxiv.2404.05206,
title = {SoundingActions: Learning How Actions Sound from Narrated Egocentric Videos},
author = {Changan Chen and Kumar Ashutosh and Rohit Girdhar and David Harwath and Kristen Grauman},
journal= {arXiv preprint arXiv:2404.05206},
year = {2024}
}
备注
Accepted at CVPR 2024. Project page: https://vision.cs.utexas.edu/projects/soundingactions