中文

使用音频循环与基于间隔的损失函数进行文本无关的说话人识别

声音 2025-09-30 v1 机器学习 音频与语音处理

摘要

说话人识别已成为包括安全系统、虚拟助手和个性化用户体验在内的各种应用中的关键组成部分。本文研究了CosFace损失和ArcFace损失在文本无关说话人识别中的有效性,我们使用基于VGG16模型修改的卷积神经网络架构,该架构可适应由Voxceleb1数据集生成的可变尺寸的梅尔频谱图输入。我们的方法包括实现这两种损失函数,以分析它们对模型准确性和鲁棒性的影响,其中Softmax损失函数被用作比较基线。此外,我们还研究了梅尔频谱图的尺寸及其不同的时间长度如何影响模型性能。实验结果表明,与传统的Softmax损失方法相比,识别准确率更优。此外,我们还讨论了这些发现对未来研究的影响。

关键词

引用

@article{arxiv.2509.22838,
  title  = {Text-Independent Speaker Identification Using Audio Looping With Margin Based Loss Functions},
  author = {Elliot Q C Garcia and Nicéias Silva Vilela and Kátia Pires Nascimento do Sacramento and Tiago A. E. Ferreira},
  journal= {arXiv preprint arXiv:2509.22838},
  year   = {2025}
}

备注

18 pages, 6 figures