NIST-SRE24 ABC前端音频系统分析
音频与语音处理
2025-05-22 v1 声音
摘要
我们对ABC团队为NIST SRE 2024音频轨道开发的嵌入提取器(前端)进行了全面分析。我们遵循NIST提出的两种情景:仅使用提供的电话录音进行训练(固定条件)或添加公开数据(开放条件)。在这些约束下,我们为主导的对话电话语音(CTS)领域开发最佳的说话人嵌入提取器。我们探索了基于ResNet的不同池化机制、近期引入的ReDimNet架构,以及基于XLS-R模型的系统,该模型代表了大规模自监督预训练模型的家族。在开放条件下,我们在VoxBlink2数据集上进行训练,该数据集包含来自11万位说话人的多语言数据。我们观察到VoxBlink训练模型在性能和鲁棒性方面表现良好,我们的实验提供了开发面向说话人识别的领先前端的实用方法。
引用
@article{arxiv.2505.15320,
title = {Analysis of ABC Frontend Audio Systems for the NIST-SRE24},
author = {Sara Barahona and Anna Silnova and Ladislav Mošner and Junyi Peng and Oldřich Plchot and Johan Rohdin and Lin Zhang and Jiangyu Han and Petr Palka and Federico Landini and Lukáš Burget and Themos Stafylakis and Sandro Cumani and Dominik Boboš and Miroslav Hlavaček and Martin Kodovsky and Tomáš Pavlíček},
journal= {arXiv preprint arXiv:2505.15320},
year = {2025}
}
备注
Accepted at Interspeech 2025