RoboVox 远场说话人识别:一种基于预训练模型的新颖数据增强方法
音频与语音处理
2024-09-17 v1 声音
摘要
在本研究中,我们通过一种向注册文件添加噪声的新颖数据增强技术,解决了说话人识别的挑战。该技术有效地对齐了测试文件与注册文件的来源,增强了可比性。我们采用了多种预训练模型,其中 resnet 模型实现了最高的 DCF 0.84 和 EER 13.44。该增强技术显著将 resnet 模型的结果提升至 0.75 DCF 和 12.79 EER。对比分析揭示了 resnet 优于 ECPA、Mel-spectrogram、Payonnet 和 Titanet large 等模型。这些结果连同不同的增强方案,共同促成了本文中 RoboVox 远场说话人识别的成功。
引用
@article{arxiv.2409.10240,
title = {oboVox Far Field Speaker Recognition: A Novel Data Augmentation Approach with Pretrained Models},
author = {Muhammad Sudipto Siam Dip and Md Anik Hasan and Sapnil Sarker Bipro and Md Abdur Raiyan and Mohammod Abdul Motin},
journal= {arXiv preprint arXiv:2409.10240},
year = {2024}
}
备注
5 pages, 2 figures