中文

ChildAugment:面向零资源儿童说话人验证的数据增强方法

音频与语音处理 2024-02-26 v1 声音

摘要

现代自动说话人验证(ASV)系统若仅使用成人数据训练,在应用于儿童语音时准确率会大幅下降。儿童语音语料库的匮乏阻碍了针对儿童语音的 ASV 系统微调。因此,亟需探索更有效的重用成人语音数据的方法。一种有前景的方法是通过儿童特定的数据增强(此处称为 ChildAugment)来对齐成人与儿童的声道参数。具体而言,我们修改成人语音的共振峰频率和共振峰带宽以模拟儿童语音。修改后的频谱用于训练面向儿童的 ECAPA-TDNN(强调通道注意力、传播和时间延迟神经网络中的聚合)识别器。我们将 ChildAugment 与各种最先进的儿童 ASV 数据增强技术进行了比较。我们还广泛比较了不同的评分方法,包括余弦评分、PLDA(概率线性判别分析)和 NPLDA(神经 PLDA)。此外,我们提出了一种低复杂度的加权余弦评分,适用于极低资源的儿童 ASV。我们在 CSLU kids 语料库上的发现表明,ChildAugment 作为一种简单且基于声学的方法,在改进基于深度学习的最新儿童 ASV 方面具有潜力。相较于基线,我们实现了高达 12.45%(男孩)和 11.96%(女孩)的相对提升。

关键词

引用

@article{arxiv.2402.15214,
  title  = {ChildAugment: Data Augmentation Methods for Zero-Resource Children's Speaker Verification},
  author = {Vishwanath Pratap Singh and Md Sahidullah and Tomi Kinnunen},
  journal= {arXiv preprint arXiv:2402.15214},
  year   = {2024}
}

备注

The following article has been accepted by The Journal of the Acoustical Society of America (JASA). After it is published, it will be found at https://pubs.aip.org/asa/jasa