中文

SVLDL:利用选择性方差标签分布学习改进说话人年龄估计

声音 2022-11-17 v2 机器学习 音频与语音处理

摘要

从单条语音中估计年龄是一个经典且具有挑战性的课题。尽管标签分布学习(LDL)能很好地表示相邻难以区分的年龄,但每个人语音的年龄估计不确定性因人而异,即年龄分布的方差不同。为解决此问题,我们提出选择性方差标签分布学习(SVLDL)方法,以适配不同年龄分布的方差。此外,模型使用WavLM作为语音特征提取器,并加入性别识别辅助任务以进一步提升性能。在损失函数上采用两种技巧,以增强年龄估计的鲁棒性并改善拟合年龄分布的质量。大量实验表明,该模型在NIST SRE08-10及一个真实世界数据集的各方面均取得了最先进的性能。

关键词

引用

@article{arxiv.2210.09524,
  title  = {SVLDL: Improved Speaker Age Estimation Using Selective Variance Label Distribution Learning},
  author = {Zuheng Kang and Jianzong Wang and Junqing Peng and Jing Xiao},
  journal= {arXiv preprint arXiv:2210.09524},
  year   = {2022}
}

备注

Accepted by SLT 2022. The 2022 IEEE Spoken Language Technology Workshop (SLT 2022)