中文

无视频的 VoxCeleb 数据源嵌入的前沿方法

音频与语音处理 2025-12-01 v2

摘要

本文细化并验证了使用弱标注训练说话人嵌入提取器的方法。具体而言,我们仅使用源 VoxCeleb 视频的音频流以及演员的姓名,而不知道他们在录音中出现的具体时间区间。我们实验不同的超参数和基于 ResNet 与 WavLM 的嵌入提取器。我们展示,该方法在说话人验证中实现了前沿成果,与在 VoxCeleb 数据集上以标准监督方式训练提取器的效果相当。我们还扩展了该方法,考虑与演员同时出现的来自未知说话人的片段,这些片段通常被丢弃。通过消除对说话人时间戳和多模态对齐的需求,我们的方法 unlocks 大规模弱标注语音数据的使用,使能够直接训练前沿嵌入提取器,并为 VoxCeleb 风格的数据集创建提供了无视频的替代方案。

关键词

引用

@article{arxiv.2410.02364,
  title  = {State-of-the-art Embeddings with Video-free Segmentation of the Source VoxCeleb Data},
  author = {Sara Barahona and Ladislav Mošner and Themos Stafylakis and Oldřich Plchot and Junyi Peng and Lukáš Burget and Jan Černocký},
  journal= {arXiv preprint arXiv:2410.02364},
  year   = {2025}
}

备注

Accepted at the IEEE Automatic Speech Recognition and Understanding Workshop (ASRU) 2025