基于深度学习的音视觉语音增强中的训练目标与目标函数
音频与语音处理
2019-11-05 v1 机器学习
声音
图像与视频处理
摘要
音视觉语音增强(AV-SE)是利用说话人的音频与视觉信息在噪声环境中改善语音质量与可懂度的任务。近来,深度学习技术已被采用以监督方式解决AV-SE任务。在此背景下,用于训练的目标(即待估计量)与量化该估计质量的目标函数的选择对性能至关重要。本工作是首个对一系列用于训练基于深度学习的AV-SE系统的不同目标与目标函数进行实验研究的成果。结果表明,直接估计掩码的方法在估计语音质量与可懂度上总体表现最佳,尽管直接估计对数幅度谱的模型在估计语音质量上表现同样良好。
引用
@article{arxiv.1811.06234,
title = {On Training Targets and Objective Functions for Deep-Learning-Based Audio-Visual Speech Enhancement},
author = {Daniel Michelsanti and Zheng-Hua Tan and Sigurdur Sigurdsson and Jesper Jensen},
journal= {arXiv preprint arXiv:1811.06234},
year = {2019}
}