真实场景下的说话人检测:JSALT 2019 的经验教训
音频与语音处理
2019-12-03 v1 声音
摘要
本文介绍了 JSALT 研讨会在使用单麦克风于不利场景中进行说话人检测时所解决的问题与方案。主要焦点是应对从会议到野生语音的广泛条件。我们描述了所探索的研究线索以及在这些场景中成功的一组模块。最终目标是探索说话人检测;但我们的首要发现是有效的 diarization(说话人日志)能改善检测,而没有 diarization 阶段会使性能变差。我们研究的所有不同配置都同意这一事实,并遵循一个以 diarization 作为前置阶段的主要骨干。借助该骨干,我们分析了以下问题:语音活动检测、如何处理噪声信号、域失配、如何改进聚类;以及先前阶段对最终说话人检测的整体影响。在本文中,我们展示了说话人 diarizarion(日志)的部分结果以更好理解该问题,并给出了说话人检测的最终结果。
引用
@article{arxiv.1912.00938,
title = {Speaker detection in the wild: Lessons learned from JSALT 2019},
author = {Paola Garcia and Jesus Villalba and Herve Bredin and Jun Du and Diego Castan and Alejandrina Cristia and Latane Bullock and Ling Guo and Koji Okabe and Phani Sankar Nidadavolu and Saurabh Kataria and Sizhu Chen and Leo Galmant and Marvin Lavechin and Lei Sun and Marie-Philippe Gill and Bar Ben-Yair and Sajjad Abdoli and Xin Wang and Wassim Bouaziz and Hadrien Titeux and Emmanuel Dupoux and Kong Aik Lee and Najim Dehak},
journal= {arXiv preprint arXiv:1912.00938},
year = {2019}
}
备注
Submitted to ICASSP 2020