语音修复:基于视频上下文的语音合成
声音
2023-06-02 v1 人工智能
音频与语音处理
摘要
音频与视觉模态在语音信号中天然关联:唇部运动与面部表情和语音声音相关。这促使了将视觉模态用于增强声学语音信号甚至恢复缺失音频信息的研究。具体而言,本文关注音视频语音修复问题,即合成受损音频片段中的语音,使其与相应视觉内容以及未受损音频上下文保持一致的任务。我们提出了一种基于音视频 transformer 的深度学习模型,该模型利用提供受损音频内容信息的视觉线索。它优于先前最先进的音视频模型以及纯音频基线。我们还展示了使用 AV-HuBERT(一种用于语音识别的大型音视频 transformer)提取的视觉特征适用于语音合成。
引用
@article{arxiv.2306.00489,
title = {Speech inpainting: Context-based speech synthesis guided by video},
author = {Juan F. Montesinos and Daniel Michelsanti and Gloria Haro and Zheng-Hua Tan and Jesper Jensen},
journal= {arXiv preprint arXiv:2306.00489},
year = {2023}
}
备注
Accepted in Interspeech23