多类型说话人识别中分布对齐的研究
声音
2023-09-26 v1 音频与语音处理
摘要
多类型说话人识别因其能更好地表征真实世界应用的复杂性而日益流行。然而,一个主要挑战是说话人向量在不同类型之间的分布存在显著偏移。虽然分布对齐是解决该挑战的常用方法,但以往研究主要聚焦于将源域与目标域对齐,而多类型数据的性能尚属未知。本文对主流分布对齐方法在多类型数据(需对齐多个分布)上进行了全面研究。我们从定性和定量两方面分析了多种方法。在 CN-Celeb 数据集上的实验表明,类内-类间分布对齐(WBDA)表现相对更好。然而,我们也发现所研究的方法中没有一种能在所有测试用例中持续提升性能。这表明仅对齐说话人向量的分布可能无法完全解决多类型说话人识别带来的挑战,有必要开展进一步研究以开发更全面的解决方案。
引用
@article{arxiv.2309.14158,
title = {An Investigation of Distribution Alignment in Multi-Genre Speaker Recognition},
author = {Zhenyu Zhou and Junhui Chen and Namin Wang and Lantian Li and Dong Wang},
journal= {arXiv preprint arXiv:2309.14158},
year = {2023}
}
备注
submitted to ICASSP 2024