基于半监督学习方法的说话人表征学习及其在说话人画像中的应用
音频与语音处理
2021-10-27 v1 机器学习
声音
摘要
说话人画像旨在估计年龄、身高等说话人特征,在法医学、推荐系统等领域有广泛应用。本工作中,我们提出一种半监督学习方法,以缓解说话人画像训练数据稀少的问题。这是通过利用带说话人信息的外部语料库训练更好的表征,从而有助于改进说话人画像系统来实现的。具体而言,除标准监督学习路径外,所提框架还有两条额外路径:(1) 无监督说话人表征学习路径,有助于捕获说话人信息;(2) 一致性训练路径,通过对同一说话人的语音强制产生相似预测来提升系统鲁棒性。所提方法在 TIMIT 和 NISP 数据集上评估了年龄、身高与性别估计,而 Librispeech 用作无监督外部语料库。在单任务与多任务设置下训练,我们的方法在 TIMIT 测试集的年龄估计上均取得了最优结果,男性与女性说话人的均方根误差(RMSE)分别为 6.8 和 7.4 年,平均绝对误差(MAE)分别为 4.8 和 5.0 年。
引用
@article{arxiv.2110.13653,
title = {Learning Speaker Representation with Semi-supervised Learning approach for Speaker Profiling},
author = {Shangeth Rajaa and Pham Van Tung and Chng Eng Siong},
journal= {arXiv preprint arXiv:2110.13653},
year = {2021}
}
备注
5 pages, 4 figures