用于耳语向正常语音转换的注意力引导生成对抗网络
声音
2021-11-03 v1 人机交互
音频与语音处理
摘要
耳语语音是一种不使用声带振动的特殊发音方式。耳语语音不包含基频,其能量比正常语音低约 20dB。将耳语语音转换为正常语音可改善语音质量和可懂度。本文提出了一种新颖的注意力引导生成对抗网络模型,该模型结合了自编码器、孪生神经网络和恒等映射损失函数,用于耳语到正常语音的转换(AGAN-W2SC)。所提方法避免了从耳语语音转换得到的正常浊音语音的基频估计难题。具体而言,由于训练时无需对齐语音特征,所提模型更易于实际应用。实验结果表明,与基于动态时间规整的方法相比,所提 AGAN-W2SC 能获得更好的语音质量和可懂度。
引用
@article{arxiv.2111.01342,
title = {Attention-Guided Generative Adversarial Network for Whisper to Normal Speech Conversion},
author = {Teng Gao and Jian Zhou and Huabin Wang and Liang Tao and Hon Keung Kwan},
journal= {arXiv preprint arXiv:2111.01342},
year = {2021}
}