时空稀疏:基于可训练选择器的音视频同步
计算机视觉与模式识别
2022-10-14 v1 机器学习
多媒体
声音
音频与语音处理
摘要
本文的目标是通用“野外”视频的音视频同步。对于此类视频,可用于同步线索的事件可能在空间上很小,并且可能仅在长达数秒的视频片段中偶尔出现,即同步信号在“时空上稀疏”。这与说话头部视频的同步情况形成对比,后者的音视频对应在时间和空间上都是密集的。我们做出了四点贡献:(i)为了处理稀疏同步信号所需的更长时序序列,我们设计了一个多模态 transformer 模型,该模型采用“选择器”将长音频和视频流提炼为小序列,然后用于预测流之间的时间偏移。(ii)我们识别出由音视频压缩编解码器引起的伪影,这些伪影可能在训练中被音视频模型利用以人为地解决同步任务。(iii)我们整理了一个仅具有时空稀疏同步信号的数据集;以及(iv)所提模型在密集和稀疏数据集上的有效性和定性、定量效果均得到展示。项目页面:v-iashin.github.io/SparseSync
引用
@article{arxiv.2210.07055,
title = {Sparse in Space and Time: Audio-visual Synchronisation with Trainable Selectors},
author = {Vladimir Iashin and Weidi Xie and Esa Rahtu and Andrew Zisserman},
journal= {arXiv preprint arXiv:2210.07055},
year = {2022}
}
备注
Accepted as a spotlight presentation for the BMVC 2022. Code: https://github.com/v-iashin/SparseSync Project page: https://v-iashin.github.io/SparseSync