无视频的 VoxCeleb 数据源嵌入的前沿方法
音频与语音处理
2025-12-01 v2
摘要
本文细化并验证了使用弱标注训练说话人嵌入提取器的方法。具体而言,我们仅使用源 VoxCeleb 视频的音频流以及演员的姓名,而不知道他们在录音中出现的具体时间区间。我们实验不同的超参数和基于 ResNet 与 WavLM 的嵌入提取器。我们展示,该方法在说话人验证中实现了前沿成果,与在 VoxCeleb 数据集上以标准监督方式训练提取器的效果相当。我们还扩展了该方法,考虑与演员同时出现的来自未知说话人的片段,这些片段通常被丢弃。通过消除对说话人时间戳和多模态对齐的需求,我们的方法 unlocks 大规模弱标注语音数据的使用,使能够直接训练前沿嵌入提取器,并为 VoxCeleb 风格的数据集创建提供了无视频的替代方案。
引用
@article{arxiv.2410.02364,
title = {State-of-the-art Embeddings with Video-free Segmentation of the Source VoxCeleb Data},
author = {Sara Barahona and Ladislav Mošner and Themos Stafylakis and Oldřich Plchot and Junyi Peng and Lukáš Burget and Jan Černocký},
journal= {arXiv preprint arXiv:2410.02364},
year = {2025}
}
备注
Accepted at the IEEE Automatic Speech Recognition and Understanding Workshop (ASRU) 2025