通过全卷积神经网络实现直接评估指标优化的端到端波形语句增强
机器学习
2018-03-16 v2 机器学习
声音
摘要
语音增强模型用于将有噪语音映射为干净语音。在训练阶段,常采用目标函数优化模型参数。然而,在大多数研究中,模型优化准则与增强语音的评估准则之间存在不一致。例如,在衡量语音可懂度时,大多数评估指标基于短时客观可懂度(STOI)度量,而估计语音与干净语音之间基于帧的最小均方误差(MMSE)被广泛用于模型优化。由于这种不一致性,无法保证训练好的模型在实际应用中提供最优性能。本研究提出一种使用全卷积神经网络(FCN)的端到端基于语句的语音增强框架,以缩小模型优化与评估准则之间的差距。由于基于语句的优化,当使用基于感知的目标函数进行直接优化时,可以考虑长语音段甚至整个语句级别的时间相关信息。作为示例,我们实现了所提出的FCN增强框架来优化STOI度量。实验结果表明,由于训练和评估目标的一致性,测试语音的STOI优于传统的MMSE优化语音。此外,通过在模型优化中集成STOI,增强语音上人类受试者的可懂度和自动语音识别(ASR)系统的性能相比MMSE准则生成的也有实质性提升。
引用
@article{arxiv.1709.03658,
title = {End-to-End Waveform Utterance Enhancement for Direct Evaluation Metrics Optimization by Fully Convolutional Neural Networks},
author = {Szu-Wei Fu and Tao-Wei Wang and Yu Tsao and Xugang Lu and Hisashi Kawai},
journal= {arXiv preprint arXiv:1709.03658},
year = {2018}
}
备注
Accepted in IEEE Transactions on Audio, Speech and Language Processing (TASLP)