2024 年文本相关说话人验证 (TdSV) 挑战赛:Naive 团队系统报告
声音
2026-05-15 v1 机器学习
摘要
本文提出了一个用于 2024 年文本相关说话人验证 (TdSV) 挑战赛的系统。该系统实现了 0.0461 的最小检测代价函数 (MinDCF) 和 1.3\% 的等错误率 (EER)。我们的方法侧重于适配现有的 SOTA 神经网络 ResNet-TDNN 和 NeXt-TDNN,它们最初在 VoxCeleb 数据集上训练。选择这一策略是因为挑战赛持续时间有限以及当时的可用资源。此外,我们设计了一个轻量且资源高效的模型 EfficientNet-A0,专门在挑战赛数据集上训练,以改进适配并增强集成方法。我们的系统结合了先进的神经架构、广泛的数据增强和优化的超参数。这些组件帮助我们在文本相关说话人验证中取得了强劲的性能。结果还证明了多模型集成学习在说话人和短语验证上的有效性。
关键词
引用
@article{arxiv.2605.14896,
title = {Text-Dependent Speaker Verification (TdSV) Challenge 2024: Team Naive System Report},
author = {Amir Mohammad Rostami and Pourya Jafarzadeh},
journal= {arXiv preprint arXiv:2605.14896},
year = {2026}
}