中文

纯音频说话人日志系统的增强方法

音频与语音处理 2019-09-04 v1 声音

摘要

本文提出了两种不同的方法来增强说话人日志系统中最具挑战性组件的性能,即说话人聚类部分。提出了一种处理步骤,通过结合非线性滤波的时间平滑过程来增强输入特征。我们还提出了对深度嵌入聚类(DEC)算法——一种非线性特征变换——的改进。这些增强方法的性能与不同聚类算法进行了比较,如 UISRNN、k-Means、谱聚类和 x-Means。评估在三个不同任务上进行,即 AMI、DIHARD 和一个内部会议转录任务。所提方法假设音频文件的说话人数量和时间段分割已知。由于本工作仅关注日志中的聚类组件,所提供的分割被假定为完美的。最后,我们展示了以给定说话人配置文件形式的监督如何进一步提升整体日志性能。所提增强在所有 3 个任务中均带来显著的相对改进,在已知说话人数量时,AMI 上提升 20%,且比 DIHARD 任务的最佳日志系统好 19%。

关键词

引用

@article{arxiv.1909.00082,
  title  = {Enhancements for Audio-only Diarization Systems},
  author = {Dimitrios Dimitriadis},
  journal= {arXiv preprint arXiv:1909.00082},
  year   = {2019}
}