基于语音信号使用 x-vectors 与迁移学习的性别与年龄联合估计
音频与语音处理
2020-12-04 v1 声音
摘要
本文扩展了 x-vector 框架,用于说话人年龄估计与性别分类任务。具体而言,我们将基线多层 TDNN 架构替换为 QuartzNet——一种在语音识别领域取得成功的卷积架构。我们进一步提出了一种两阶段迁移学习方案,利用大规模语音数据集 VoxCeleb 和 Common Voice,并使用多任务学习以单一系统实现年龄估计与性别分类的联合进行。我们在 TIMIT 数据集上训练并评估性能。所提出的迁移学习方案在年龄估计误差与性别分类准确率方面带来连续的性能提升,且最佳性能系统在 TIMIT TEST 数据集的年龄估计任务上取得了新的 SOTA 结果:男性与女性说话人的 MAE 分别为 5.12 和 5.29 年,RMSE 分别为 7.24 和 8.12 年,同时保持 99.6% 的性别分类准确率。
引用
@article{arxiv.2012.01551,
title = {Joint gender and age estimation based on speech signals using x-vectors and transfer learning},
author = {Damian Kwasny and Daria Hemmerling},
journal= {arXiv preprint arXiv:2012.01551},
year = {2020}
}