基于 Graph-PIT 的逐话语重叠感知神经说话人日志方法
音频与语音处理
2022-07-29 v1 声音
摘要
近期说话人日志研究表明,端到端神经日志(EEND)与基于聚类的日志相结合,是在多种任务上取得最优性能的有前景途径。该方法首先将观测信号划分为固定长度片段,然后基于 EEND 模块进行{\it 片段级}局部日志,并通过聚类合并片段级结果以形成最终全局日志。由于当前 EEND 无法处理大量说话人,故采用分段以限制各片段内说话人数量。本文指出,这种涉及分段的方法存在若干问题;例如,其不可避免地面临两难:更大的片段尺寸虽能增加可用于提升性能的上下文,却也增加了局部 EEND 模块需处理的说话人数量。为解决该问题,本文提出一种无需分段的新型日志框架,但仍可处理包含众多说话人及大量重叠语音的挑战性数据。所提方法可对整场会议进行推断,并执行{\it 逐话语}日志,即按说话人对话语活动进行聚类。为此,我们利用近期提出的用于神经源分离的神经网络训练方案 Graph-PIT。基于模拟活跃会议类数据与 CALLHOME 数据的实验表明了该方法相对于传统方法的优越性。
引用
@article{arxiv.2207.13888,
title = {Utterance-by-utterance overlap-aware neural diarization with Graph-PIT},
author = {Keisuke Kinoshita and Thilo von Neumann and Marc Delcroix and Christoph Boeddeker and Reinhold Haeb-Umbach},
journal= {arXiv preprint arXiv:2207.13888},
year = {2022}
}
备注
Accepted to Interspeech 2022 (5 pages, 1 figure)