中文

目标说话人语音活动检测:宴会场景多说话人日记化的新方法

音频与语音处理 2020-11-03 v2 计算与语言 声音

摘要

真实场景下的说话人日记化是一个极具挑战性的问题。广泛使用的基于聚类的日记化方法在此类条件下表现相当差,主要由于处理重叠语音的能力有限。我们提出一种新颖的目标说话人语音活动检测(TS-VAD)方法,直接预测每个说话人在每一时间帧上的活动。TS-VAD 模型以常规语音特征(如 MFCC)以及每个说话人的 i-vectors 作为输入。一组二分类输出层产生各说话人的活动。i-vectors 可从基于强聚类的日记化结果出发迭代估计。我们还通过在使用单通道 TS-VAD 模型提取的隐藏表示之上采用简单注意力机制,将 TS-VAD 方法扩展到多麦克风情形。此外,研究了针对预测说话人活动概率的后处理策略。在 CHiME-6 未分段数据上的实验表明,TS-VAD 取得了最先进的结果,以超过 30% 的绝对日记化错误率(DER)优于基线的 x-vector 系统。

关键词

引用

@article{arxiv.2005.07272,
  title  = {Target-Speaker Voice Activity Detection: a Novel Approach for Multi-Speaker Diarization in a Dinner Party Scenario},
  author = {Ivan Medennikov and Maxim Korenevsky and Tatiana Prisyach and Yuri Khokhlov and Mariya Korenevskaya and Ivan Sorokin and Tatiana Timofeeva and Anton Mitrofanov and Andrei Andrusenko and Ivan Podluzhny and Aleksandr Laptev and Aleksei Romanenko},
  journal= {arXiv preprint arXiv:2005.07272},
  year   = {2020}
}

备注

Accepted to Interspeech 2020