中文

ModEFormer:基于Transformer的模态保持嵌入用于音视频同步

计算机视觉与模式识别 2023-03-22 v1 机器学习 声音 音频与语音处理 图像与视频处理

摘要

音视频不同步是电视广播和视频会议中的常见问题,导致不佳的观看体验。一种被广泛接受的范式是创建错误检测机制,以识别音频超前或滞后的情形。我们提出ModEFormer,它使用模态特定的transformers独立提取音频和视频嵌入。与其他基于transformer的方法不同,ModEFormer保持输入流的模态,这使我们能够使用更大的批大小及更多负音频样本进行对比学习。进一步,我们提出了批中负样本数量与唯一样本数量之间的权衡,以显著超越先前方法的性能。实验结果显示,ModEFormer在LRS2上取得了94.5%、在LRS3上取得了90.9%的最优性能。最后,我们展示了ModEFormer如何用于测试片段的偏移检测。

关键词

引用

@article{arxiv.2303.11551,
  title  = {ModEFormer: Modality-Preserving Embedding for Audio-Video Synchronization using Transformers},
  author = {Akash Gupta and Rohun Tripathi and Wondong Jang},
  journal= {arXiv preprint arXiv:2303.11551},
  year   = {2023}
}

备注

Paper accepted at ICASSP 2023