基于单元选择合成的固定短语说话人确认数据增强
声音
2021-02-22 v1 音频与语音处理
摘要
数据增强常用于帮助构建鲁棒的说话人确认系统,尤其在资源有限的情况下。然而,传统数据增强方法通常关注声学环境的多样性,忽视了词汇变化。对于文本相关说话人确认任务,众所周知准备带有目标文本的训练数据是构建高性能系统最有效的方式,但收集此类数据耗时且昂贵。本文中,我们提出一种基于单元选择合成的数据增强方法,以利用丰富的文本无关数据资源。该方法中,每位说话人的文本无关语音首先被切分为各含一个音素单元的语音段。然后选择包含目标文本中音素的段,按顺序拼接以生成带有目标文本的语音。在 AISHELL 说话人确认挑战 2019 数据库上进行了实验,结果与分析表明所提方法能显著提升系统性能。
引用
@article{arxiv.2102.09817,
title = {Unit selection synthesis based data augmentation for fixed phrase speaker verification},
author = {Houjun Huang and Xu Xiang and Fei Zhao and Shuai Wang and Yanmin Qian},
journal= {arXiv preprint arXiv:2102.09817},
year = {2021}
}
备注
Accepted to ICASSP 2021