中文

基于 Bi-LSTM 打分相似度度量与凝聚层次聚类(AHC)的说话人日记化

音频与语音处理 2022-05-20 v1 人工智能 计算与语言 计算机视觉与模式识别 机器学习

摘要

不同场景下的多数语音信号从未以仅含单一说话人的明确音频段形式提供。两人间的典型对话包含声音重叠、互相打断或于多句之间停顿的片段。近期日记化技术的进展利用基于神经网络的方法改进说话人日记化系统的多个子系统,包括提取片段级嵌入特征与检测对话中说话人变化。然而,为通过聚类识别说话人,模型依赖如 PLDA 等方法生成给定对话音频中两提取片段间的相似度度量。由于这些算法忽略对话的时间结构,往往导致较高的日记化错误率(DER),从而在说话人与变化识别上均出现误检。因此,为独立且顺序地比较两个语音片段的相似性,我们提出一种双向长短期记忆网络来估计相似度矩阵中的元素。一旦生成相似度矩阵,便应用凝聚层次聚类(AHC)基于阈值进一步识别说话人片段。为评估性能,采用日记化错误率(DER%)指标。所提模型在源自 ICSI Meeting Corpus 的测试音频集上取得 34.80% 的低 DER,而传统基于 PLDA 的相似度度量机制 DER 为 39.90%。

关键词

引用

@article{arxiv.2205.09709,
  title  = {Bi-LSTM Scoring Based Similarity Measurement with Agglomerative Hierarchical Clustering (AHC) for Speaker Diarization},
  author = {Siddharth S. Nijhawan and Homayoon Beigi},
  journal= {arXiv preprint arXiv:2205.09709},
  year   = {2022}
}

备注

8 pages, 3 figures, 2 tables, 1 algorithm, Technical Report: Recognition Technologies, Inc