中文

利用说话人嵌入与对抗多任务学习进行年龄组分类

音频与语音处理 2023-01-24 v1 机器学习

摘要

近来,研究者已在说话人识别任务中利用基于神经网络的说话人嵌入技术来准确辨识说话人。然而,说话人判别性嵌入并非总能很好地表征诸如年龄组之类的语音特征。在高度训练以捕获说话人特质的嵌入模型中,年龄组分类任务更接近于语音信息泄露。因此,为提升年龄组分类性能,我们考虑使用源自对抗多任务学习的说话人判别性嵌入,以对齐特征并减小年龄子组间的域差异。此外,我们探究了不同类型的说话人嵌入,以学习并泛化年龄组的域不变表示。在 VoxCeleb Enrichment 数据集上的实验结果验证了我们所提自适应对抗网络在多目标场景中的有效性,以及利用说话人嵌入进行域自适应任务的有效性。

关键词

引用

@article{arxiv.2301.09058,
  title  = {Leveraging Speaker Embeddings with Adversarial Multi-task Learning for Age Group Classification},
  author = {Kwangje Baeg and Yeong-Gwan Kim and Young-Sub Han and Byoung-Ki Jeon},
  journal= {arXiv preprint arXiv:2301.09058},
  year   = {2023}
}