在线说话人分割方法综述
声音
2024-06-21 v1 计算与语言
音频与语音处理
摘要
说话人分割回答了“谁何时说话”的 вопрос для音频文件。这种信息可用于完成音频的转录,以进行后续处理步骤。大多数说话人分割系统假设整个音频文件可用。然而,在需要在音频片段到达后立即获得说话人标签的场景中,要求低延迟的说话人分割称为在线说话人分割。本文提供了概述。首先简要介绍了在线说话人分割的历史。随后给出分类法和用于训练与评估的数据集。在随后的章节中,详细讨论了在线分割方法与系统。本文 concludes with the presentation of challenges that still need to be solved by future research in the field of online speaker diarization.(注:根据要求,摘要保持原结构,以下为中文译文)
引用
@article{arxiv.2406.14464,
title = {A Review of Common Online Speaker Diarization Methods},
author = {Roman Aperdannier and Sigurd Schacht and Alexander Piazza},
journal= {arXiv preprint arXiv:2406.14464},
year = {2024}
}
备注
6 pages