视觉线索在视听语音增强中的作用探析
机器学习
2021-02-26 v4 计算与语言
计算机视觉与模式识别
声音
音频与语音处理
摘要
我们呈现了对一个视听语音增强模型的内省分析。特别地,我们聚焦于解释神经视听语音增强模型如何利用视觉线索来提升目标语音信号的质量。我们表明视觉线索不仅提供关于语音活动(即语音/静音)的高层信息,还提供关于发音部位的细粒度视觉信息。该发现的一个副产品是,学习到的视觉嵌入可作为其他视觉语音应用的特征。我们展示了学习到的视觉嵌入在分类视位(对应于音位的视觉类比)上的有效性。我们的结果深入揭示了视听语音增强的重要方面,并展示了此类模型如何用于视觉语音应用的自监督任务。
引用
@article{arxiv.2004.12031,
title = {On the Role of Visual Cues in Audiovisual Speech Enhancement},
author = {Zakaria Aldeneh and Anushree Prasanna Kumar and Barry-John Theobald and Erik Marchi and Sachin Kajarekar and Devang Naik and Ahmed Hussen Abdelaziz},
journal= {arXiv preprint arXiv:2004.12031},
year = {2021}
}
备注
ICASSP 2021