中文

RoboVox 远场说话人识别:一种基于预训练模型的新颖数据增强方法

音频与语音处理 2024-09-17 v1 声音

摘要

在本研究中,我们通过一种向注册文件添加噪声的新颖数据增强技术,解决了说话人识别的挑战。该技术有效地对齐了测试文件与注册文件的来源,增强了可比性。我们采用了多种预训练模型,其中 resnet 模型实现了最高的 DCF 0.84 和 EER 13.44。该增强技术显著将 resnet 模型的结果提升至 0.75 DCF 和 12.79 EER。对比分析揭示了 resnet 优于 ECPA、Mel-spectrogram、Payonnet 和 Titanet large 等模型。这些结果连同不同的增强方案,共同促成了本文中 RoboVox 远场说话人识别的成功。

关键词

引用

@article{arxiv.2409.10240,
  title  = {oboVox Far Field Speaker Recognition: A Novel Data Augmentation Approach with Pretrained Models},
  author = {Muhammad Sudipto Siam Dip and Md Anik Hasan and Sapnil Sarker Bipro and Md Abdur Raiyan and Mohammod Abdul Motin},
  journal= {arXiv preprint arXiv:2409.10240},
  year   = {2024}
}

备注

5 pages, 2 figures