SVLDL:利用选择性方差标签分布学习改进说话人年龄估计
声音
2022-11-17 v2 机器学习
音频与语音处理
摘要
从单条语音中估计年龄是一个经典且具有挑战性的课题。尽管标签分布学习(LDL)能很好地表示相邻难以区分的年龄,但每个人语音的年龄估计不确定性因人而异,即年龄分布的方差不同。为解决此问题,我们提出选择性方差标签分布学习(SVLDL)方法,以适配不同年龄分布的方差。此外,模型使用WavLM作为语音特征提取器,并加入性别识别辅助任务以进一步提升性能。在损失函数上采用两种技巧,以增强年龄估计的鲁棒性并改善拟合年龄分布的质量。大量实验表明,该模型在NIST SRE08-10及一个真实世界数据集的各方面均取得了最先进的性能。
引用
@article{arxiv.2210.09524,
title = {SVLDL: Improved Speaker Age Estimation Using Selective Variance Label Distribution Learning},
author = {Zuheng Kang and Jianzong Wang and Junqing Peng and Jing Xiao},
journal= {arXiv preprint arXiv:2210.09524},
year = {2022}
}
备注
Accepted by SLT 2022. The 2022 IEEE Spoken Language Technology Workshop (SLT 2022)