面向零样本多说话人语音合成的注意力剪枝
声音
2023-08-30 v1 机器学习
音频与语音处理
摘要
对于个性化语音生成,神经文本到语音(TTS)模型必须能在目标说话人有限数据下成功实现。为此,基线 TTS 模型需充分泛化到域外数据(即目标说话人语音)。然而,解决 TTS 中域外泛化问题的方法尚缺乏深入研究。本工作中,我们提出一种针对 transformer 的有效剪枝方法,称为稀疏注意力,以提升 TTS 模型的泛化能力。具体而言,我们剪除自注意力层中注意力权重低于阈值的冗余连接。为灵活确定剪枝强度以搜索最优泛化程度,我们还提出一种新的可微分剪枝方法,使模型自动学习阈值。在零样本多说话人 TTS 上的评估验证了我们的方法在音质与说话人相似度方面的有效性。
引用
@article{arxiv.2308.14909,
title = {Pruning Self-Attention for Zero-Shot Multi-Speaker Text-to-Speech},
author = {Hyungchan Yoon and Changhwan Kim and Eunwoo Song and Hyun-Wook Yoon and Hong-Goo Kang},
journal= {arXiv preprint arXiv:2308.14909},
year = {2023}
}
备注
INTERSPEECH 2023