中文

多说话人环境下基于人脸标志点的说话人无关视听语音增强

计算与语言 2021-02-04 v3 机器学习 声音 音频与语音处理

摘要

在本文中,我们解决在鸡尾酒会场景中,当可用说话人感兴趣者的视觉信息时,增强该说话人语音的问题。与大多数先前研究相反,我们不在通常较小的视听数据集上学习视觉特征,而是使用已有的脸标志点检测器(在独立图像数据集上训练)。LSTM 模型利用这些标志点生成时频掩码,并将其应用于声学混合语音谱图。结果表明:(i) 标志点运动特征对该任务非常有效,(ii) 与先前工作类似,通过掩码中介重建目标说话人谱图比直接谱图重建显著更准确,以及 (iii) 最佳掩码依赖于运动标志点特征和输入混合语音谱图两者。据我们所知,我们提出的模型是在有限规模的 GRID 和 TCD-TIMIT 数据集上训练和评估的、首个在多说话人设定中实现说话人无关语音增强的模型。

关键词

引用

@article{arxiv.1811.02480,
  title  = {Face Landmark-based Speaker-Independent Audio-Visual Speech Enhancement in Multi-Talker Environments},
  author = {Giovanni Morrone and Luca Pasa and Vadim Tikhanoff and Sonia Bergamaschi and Luciano Fadiga and Leonardo Badino},
  journal= {arXiv preprint arXiv:1811.02480},
  year   = {2021}
}

备注

Proceedings of 2019 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)