窥探你的言语:学习用于音视频语音分离的跨模态亲和性
计算机视觉与模式识别
2021-04-08 v1 声音
音频与语音处理
图像与视频处理
摘要
本文中,我们解决利用音视频神经处理从视频中分离个体语音信号的问题。大多数传统方法利用逐帧匹配准则来提取同时出现的音频与视频之间的共享信息。因此,它们的性能严重依赖于音视频同步的准确性及其表征的有效性。为克服由于传输延迟失配或抖动导致的两模态间帧不连续问题,我们提出一种跨模态亲和网络(CaffNet),该网络学习音频与视频流之间的全局对应关系以及局部变化的亲和性。鉴于全局项在话语级别为时间序列提供稳定性,这解决了以不一致分配为特征的标签排列问题。通过将所提跨模态亲和性扩展到复数网络,我们进一步提升了复数谱域中的分离性能。实验结果验证了所提方法在各种数据集上优于传统方法,展示了其在真实场景中的优势。
引用
@article{arxiv.2104.02775,
title = {Looking into Your Speech: Learning Cross-modal Affinity for Audio-visual Speech Separation},
author = {Jiyoung Lee and Soo-Whan Chung and Sunok Kim and Hong-Goo Kang and Kwanghoon Sohn},
journal= {arXiv preprint arXiv:2104.02775},
year = {2021}
}
备注
CVPR 2021. The first two authors contributed equally to this work. Project page: https://caffnet.github.io