基于弱监督语音活动检测的说话人嵌入用于高效说话人分割
音频与语音处理
2024-05-16 v1 声音
摘要
当前的说话人分割系统依赖于说话人嵌入提取前的外部语音活动检测模型。本文证明,说话人嵌入提取器的注意力系统充当了弱监督的内部 VAD 模型,性能与可比监督 VAD 系统相当。随后,可以通过同时提取 VAD 概念和对应的说话人嵌入来实现说话人分割,从而减轻外部 VAD 模型及其计算开销的需求。我们对当前说话人验证模型中帧级注意力系统的行为进行了广泛分析,并提出了一种使用 ECAPA2 说话人嵌入同时用于 VAD 和嵌入提取的新型说话人分割管道。该策略在 AMI、VoxConverse 和 DIHARD III 等分割基准上实现了最先进的性能。
引用
@article{arxiv.2405.09142,
title = {Speaker Embeddings With Weakly Supervised Voice Activity Detection For Efficient Speaker Diarization},
author = {Jenthe Thienpondt and Kris Demuynck},
journal= {arXiv preprint arXiv:2405.09142},
year = {2024}
}
备注
Proceedings of Odyssey 2024: The Speaker and Language Recognition Workshop