基于无监督信息瓶颈的会议说话人日志新型架构
音频与语音处理
2021-03-05 v1
摘要
说话人日志是一个重要且热门的问题,尤其作为会话语音相关应用的预处理器极为有用。本文目标有二:(i) 通过初始段间均匀分配说话人信息实现段初始化;(ii) 将说话人判别特征纳入无监督日志框架。工作的第一部分,提出一种基于信息瓶颈(IB)的说话人日志系统的变长段初始化技术,以音素率作为侧信息。该初始化在段间均匀分配说话人信息,为 IB 聚类提供更好起点。第二部分,我们提出一种两遍信息瓶颈(TPIB)的说话人日志系统,在日志过程中融入说话人判别特征。TPIB 说话人日志系统较基线 IB 系统有所提升。TPIB 系统第一遍使用 IB 聚类进行粗分割,所得对齐用于通过浅层前馈神经网络与线性判别分析生成说话人判别特征。所得判别特征用于第二遍获取最终说话人边界。论文最后将变长段初始化与 TPIB 框架结合,兼顾更优段初始化与说话人判别特征的优势,带来额外性能提升。在标准会议数据集上的评估显示,在 NIST 与 AMI 数据集上分别获得 3.9% 与 4.7% 的绝对显著提升。
引用
@article{arxiv.2010.06304,
title = {Novel Architectures for Unsupervised Information Bottleneck based Speaker Diarization of Meetings},
author = {Nauman Dawalatabad and Srikanth Madikeri and C. Chandra Sekhar and Hema A. Murthy},
journal= {arXiv preprint arXiv:2010.06304},
year = {2021}
}
备注
Accepted in IEEE/ACM TRANSACTIONS ON AUDIO, SPEECH, AND LANGUAGE PROCESSING