ModEFormer:基于Transformer的模态保持嵌入用于音视频同步
计算机视觉与模式识别
2023-03-22 v1 机器学习
声音
音频与语音处理
图像与视频处理
摘要
音视频不同步是电视广播和视频会议中的常见问题,导致不佳的观看体验。一种被广泛接受的范式是创建错误检测机制,以识别音频超前或滞后的情形。我们提出ModEFormer,它使用模态特定的transformers独立提取音频和视频嵌入。与其他基于transformer的方法不同,ModEFormer保持输入流的模态,这使我们能够使用更大的批大小及更多负音频样本进行对比学习。进一步,我们提出了批中负样本数量与唯一样本数量之间的权衡,以显著超越先前方法的性能。实验结果显示,ModEFormer在LRS2上取得了94.5%、在LRS3上取得了90.9%的最优性能。最后,我们展示了ModEFormer如何用于测试片段的偏移检测。
关键词
引用
@article{arxiv.2303.11551,
title = {ModEFormer: Modality-Preserving Embedding for Audio-Video Synchronization using Transformers},
author = {Akash Gupta and Rohun Tripathi and Wondong Jang},
journal= {arXiv preprint arXiv:2303.11551},
year = {2023}
}
备注
Paper accepted at ICASSP 2023