跨年龄说话人验证:学习年龄不变的说话人嵌入
音频与语音处理
2022-07-14 v1 声音
摘要
自动说话人验证近年来取得显著进展。然而,由于相关数据的缺乏,关于跨年龄说话人验证(CASV)的研究甚少。本文基于 VoxCeleb 数据集挖掘跨年龄测试集,并提出我们的年龄不变说话人表示(AISR)学习方法。由于 VoxCeleb 采集自 YouTube 平台,该数据集天然包含跨年龄数据。但元数据不含说话人年龄标签。因此,我们采用人脸年龄估计方法从关联视觉数据预测说话人年龄值,再用估计年龄标注音频录音。我们在 VoxCeleb 上构建多个跨年龄测试集(Vox-CA),其刻意选取年龄差较大的正例 trial。同时,在选取负对时考虑国籍与性别的影响以与 Vox-H 情形对齐。基线系统性能从 Vox-H 测试集上的 1.939\% EER 降至 Vox-CA20 测试集上的 10.419\% EER,表明跨年龄场景之困难。为此,我们提出年龄解耦对抗学习(ADAL)方法以缓解年龄差的负面影响并降低类内方差。我们的方法在 Vox-CA20 测试集上相较基线系统取得超过 10\% 的相关 EER 降低。源代码与 trial 资源见 https://github.com/qinxiaoyi/Cross-Age_Speaker_Verification
引用
@article{arxiv.2207.05929,
title = {Cross-Age Speaker Verification: Learning Age-Invariant Speaker Embeddings},
author = {Xiaoyi Qin and Na Li and Chao Weng and Dan Su and Ming Li},
journal= {arXiv preprint arXiv:2207.05929},
year = {2022}
}
备注
Accepted by Interspeech2022