中文

VoxVietnam:面向越南语说话人识别的大规模多类型数据集

声音 2025-01-03 v1 计算与语言 音频与语音处理

摘要

最近的说话人识别研究旨在解决因enrolment与test说话片段之间的差异而导致的脆弱性问题,尤其是在utterances处于不同语种中的多类型现象。以往为越南语说话人识别提供的资源要么规模有限,要么不关注语种多样性,留下了对多类型效应的研究未被探索。本文介绍VoxVietnam,首个面向越南语说话人识别的多类型数据集,包含超过18.7万个utterances,来自1406位说话人,以及一个在大规模来源上自动构建数据集的管道。我们的实验表明,单类型数据集训练的模型面临多类型现象的挑战,而将VoxVietnam纳入训练过程后,性能显著提升。我们的实验旨在探讨多类型现象在说话人识别中的挑战,以及在采用该数据集进行多类型训练时性能提升的情形。

关键词

引用

@article{arxiv.2501.00328,
  title  = {VoxVietnam: a Large-Scale Multi-Genre Dataset for Vietnamese Speaker Recognition},
  author = {Hoang Long Vu and Phuong Tuan Dat and Pham Thao Nhi and Nguyen Song Hao and Nguyen Thi Thu Trang},
  journal= {arXiv preprint arXiv:2501.00328},
  year   = {2025}
}

备注

Accepted to 2025 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2025)