Synchformer:基于稀疏线索的高效同步
计算机视觉与模式识别
2024-01-30 v1 机器学习
多媒体
声音
音频与语音处理
摘要
我们的目标是音频-视觉同步,重点关注“野外”视频(如YouTube上的视频),其中同步线索可能稀疏。我们的贡献包括一种新颖的音频-视觉同步模型,以及通过多模态片段级对比预训练将特征提取与同步建模解耦的训练方法。该方法在密集和稀疏场景下均达到了最先进的性能。我们还将同步模型训练扩展到百万级“野外”数据集AudioSet,研究了用于可解释性的证据归因技术,并探索了同步模型的新能力:音频-视觉可同步性。
引用
@article{arxiv.2401.16423,
title = {Synchformer: Efficient Synchronization from Sparse Cues},
author = {Vladimir Iashin and Weidi Xie and Esa Rahtu and Andrew Zisserman},
journal= {arXiv preprint arXiv:2401.16423},
year = {2024}
}
备注
Extended version of the ICASSP 24 paper. Project page: https://www.robots.ox.ac.uk/~vgg/research/synchformer/ Code: https://github.com/v-iashin/Synchformer