中文

鲁棒声学域识别及其在说话人日记化中的应用

声音 2022-08-09 v2 音频与语音处理

摘要

近年来随着多媒体内容的增长,音频的录音环境呈现出更多样化。音频处理系统若在前端具备一个识别声学域的模块,可能会受益。在本文中,我们展示了将声学域识别(ADI)用于说话人日记化(speaker diarization)的思路。为此,我们首先对第三次 DIHARD 挑战赛的各个域进行详细研究,突出将它们彼此区分开的因素。我们的主要贡献是开发一种简单高效的 ADI 解决方案。在当前工作中,我们探索将该任务的说话人嵌入用于此目的。接下来,我们将 ADI 模块与 DIHARD III 挑战赛的说话人日记化框架集成。当针对相应域优化凝聚式层次聚类的阈值时,性能较基线大幅提升。在 DIHARD III 评估集的 Track 1 上,我们在核心条件和完整条件下的 DER 分别实现了超过 5%5\%8%8\% 的相对提升。

关键词

引用

@article{arxiv.2208.03162,
  title  = {Robust Acoustic Domain Identification with its Application to Speaker Diarization},
  author = {A Kishore Kumar and Shefali Waldekar and Md Sahidullah and Goutam Saha},
  journal= {arXiv preprint arXiv:2208.03162},
  year   = {2022}
}

备注

Accepted for publication in International Journal of Speech Technology (Springer Nature)