中文

关联训练与搜索:一种用于说话人日志的统一在线聚类框架

音频与语音处理 2022-06-29 v1 多媒体

摘要

对于在线说话人日志,样本以增量方式到达,且样本的整体分布不可见。此外,在大多数现有的基于聚类的方法中,嵌入提取器的训练目标并非专为聚类而设计。为提升在线说话人日志性能,我们提出一种统一在线聚类框架,在嵌入提取器与聚类算法之间提供交互机制。具体而言,该框架由高度耦合的两部分构成:聚类引导循环训练(CGRT)与截断束搜索聚类(TBSC)。CGRT将聚类算法引入嵌入提取器的训练过程,既可为嵌入提取器提供簇感知信息,也可为后续聚类过程提供关键参数。借助这些包含度量空间初步信息的参数,TBSC对每个簇的概率得分进行惩罚,从而以低延迟在线方式输出更准确的聚类结果。通过上述创新,我们提出的在线聚类系统在AISHELL-4上以2.5秒延迟、0.25 collar取得14.48% DER,而离线凝聚层次聚类的DER为14.57%。

关键词

引用

@article{arxiv.2206.13760,
  title  = {Interrelate Training and Searching: A Unified Online Clustering Framework for Speaker Diarization},
  author = {Yifan Chen and Yifan Guo and Qingxuan Li and Gaofeng Cheng and Pengyuan Zhang and Yonghong Yan},
  journal= {arXiv preprint arXiv:2206.13760},
  year   = {2022}
}

备注

Accepted by Interspeech 2022