容错说话人模板的目标说话人语音活动检测
声音
2024-04-05 v2 音频与语音处理
摘要
目标说话人语音活动检测(TS-VAD)利用一组说话人模板与输入音频信号来执行说话人日记化。尽管其相对于传统方法的优越性已被证实,该方法可能受限于说话人模板中的错误,因为这些模板通常通过对输入信号运行传统的基于聚类的日记化方法获得。本文提出一种 TS-VAD 的扩展,称为容错说话人模板 TS-VAD(PET-TSVAD),其对此类说话人模板错误具有鲁棒性。这是通过采用可处理可变说话人数的基于 transformer 的 TS-VAD,并进一步引入一组额外的伪说话人模板以处理首次日记化中未检出的说话人来实现的。在训练期间,我们使用由多种不同聚类算法估计的说话人模板,以减小训练与测试条件之间关于说话人模板的不匹配。实验结果表明,PET-TSVAD 在 VoxConverse 与 DIHARD-I 数据集上均一致优于现有 TS-VAD 方法。
引用
@article{arxiv.2309.12521,
title = {Profile-Error-Tolerant Target-Speaker Voice Activity Detection},
author = {Dongmei Wang and Xiong Xiao and Naoyuki Kanda and Midia Yousefi and Takuya Yoshioka and Jian Wu},
journal= {arXiv preprint arXiv:2309.12521},
year = {2024}
}
备注
Submission for ICASSP 2024