中文

基于序列到序列预测的目标说话人语音活动检测

音频与语音处理 2023-02-21 v3 声音

摘要

目标说话人语音活动检测目前是复杂声学环境下说话人日记化的一种有前景的方法。本文提出一种新颖的序列到序列目标说话人语音活动检测(Seq2Seq-TSVAD)方法,可高效处理大规模说话人的联合建模并预测高分辨率语音活动。实验结果表明,更大的说话人容量与更高的输出分辨率能显著降低日记化错误率(DER),在广泛使用的评价指标下,于VoxConverse测试集上取得4.55%的新最优性能,在DIHARD-III评估集的Track 1上取得10.77%的新最优性能。

关键词

引用

@article{arxiv.2210.16127,
  title  = {Target-Speaker Voice Activity Detection via Sequence-to-Sequence Prediction},
  author = {Ming Cheng and Weiqing Wang and Yucong Zhang and Xiaoyi Qin and Ming Li},
  journal= {arXiv preprint arXiv:2210.16127},
  year   = {2023}
}

备注

Accepted by ICASSP2023