中文

USED:通用说话人提取与日记化

声音 2025-01-17 v3 音频与语音处理

摘要

说话人提取与日记化是现实世界语音应用的两项支撑技术。说话人提取旨在从语音混合中分离出目标说话人的声音,而说话人日记化则按说话人对语音段进行划分,标注“谁在何时说话”。先前研究通常将两个任务独立对待。在实际应用中,了解“谁在何时说了什么”更有意义,而这正由两项任务共同刻画。两任务有着解耦说话人的相似目标。说话人提取在频域操作,而日记化处于时域。可以合理地认为,由说话人日记化获得的说话人活动有益于说话人提取,而提取出的语音比语音混合能提供更准确的说话人活动检测。本文中,我们提出一种称为通用说话人提取与日记化(USED)的统一模型,以解决输出不一致与场景失配问题。其设计用于处理具有不同重叠比和可变说话人数的语音混合。我们表明,USED 模型在 LibriMix 与 SparseLibriMix 数据集上显著优于说话人提取与日记化任务的竞争性基线。我们进一步在基于真实录音的数据集 CALLHOME 上验证了日记化性能,实验结果表明我们的模型超越了近期提出的方法。

关键词

引用

@article{arxiv.2309.10674,
  title  = {USED: Universal Speaker Extraction and Diarization},
  author = {Junyi Ao and Mehmet Sinan Yıldırım and Ruijie Tao and Meng Ge and Shuai Wang and Yanmin Qian and Haizhou Li},
  journal= {arXiv preprint arXiv:2309.10674},
  year   = {2025}
}

备注

Accepted to TASLP