利用边界未知的Multi-Speaker音频训练说话人嵌入提取器
音频与语音处理
2022-08-10 v2
摘要
在本文中,我们展示了一种使用弱标注训练说话人嵌入提取器的方法。更具体地说,我们使用完整的 VoxCeleb 录音以及每个视频中出现的名人姓名,而不知晓名人在视频中出现的时间区间。我们表明,通过结合一个无需训练或参数调优的基线说话人日志(diarization)算法、一种在片段上聚合的改进损失以及两阶段训练方法,我们能够训练出一个具有竞争力的基于 ResNet 的嵌入提取器。最后,我们尝试了两种不同的聚合函数,并根据其梯度分析了它们的行为。
引用
@article{arxiv.2203.15436,
title = {Training Speaker Embedding Extractors Using Multi-Speaker Audio with Unknown Speaker Boundaries},
author = {Themos Stafylakis and Ladislav Mošner and Oldřich Plchot and Johan Rohdin and Anna Silnova and Lukáš Burget and Jan "Honza'' Černocký},
journal= {arXiv preprint arXiv:2203.15436},
year = {2022}
}
备注
Accepted at Interspeech 2022