中文

说话人日志技术综述:深度学习近年进展

音频与语音处理 2021-11-29 v4 计算与语言 声音

摘要

说话人日志(speaker diarization)是一项为音频或视频录音标注对应说话人身份的类别标签的任务,简言之,即识别“谁在何时说话”。早期,说话人日志算法是为多说话人音频录音的语音识别而开发的,以实现说话人自适应处理。随着时间推移,这些算法也作为独立应用展现出自身价值,为音频检索等下游任务提供说话人特定的元信息。近来,随着深度学习技术的兴起——其已驱动了语音应用领域研究与实践的革命性变化——说话人日志取得了快速进展。本文不仅回顾了说话人日志技术的历史发展,也综述了神经说话人日志方法的近期进展。此外,我们讨论了说话人日志系统如何与语音识别应用相集成,以及近期深度学习的兴起如何引领联合建模这两个组件使其互为补充的方向。考虑到这些令人振奋的技术趋势,我们相信本文通过整合神经方法的近期进展提供一篇综述工作,从而对学界有所裨益,并推动迈向更高效的说话人日志的进一步进展。

关键词

引用

@article{arxiv.2101.09624,
  title  = {A Review of Speaker Diarization: Recent Advances with Deep Learning},
  author = {Tae Jin Park and Naoyuki Kanda and Dimitrios Dimitriadis and Kyu J. Han and Shinji Watanabe and Shrikanth Narayanan},
  journal= {arXiv preprint arXiv:2101.09624},
  year   = {2021}
}

备注

This article is a preprint version of the article published in Computer Speech & Language, Volume 72, March 2022, 101317