中文

基于图神经网络进行会话级说话人嵌入精炼的说话人日志

音频与语音处理 2020-05-26 v1 机器学习 声音 机器学习

摘要

深度说话人嵌入模型常被用作说话人日志系统的基础模块;然而,说话人嵌入模型通常依据训练数据上定义的全局损失进行训练,这对于在特定会议会话中局部地区分说话人而言可能并非最优。本文首次将图神经网络(GNNs)用于说话人日志问题,利用 GNN 借助会话内各语音片段之间的结构信息对说话人嵌入进行局部精炼。预训练模型提取的说话人嵌入被重新映射到一个新的嵌入空间,在该空间中,单次会话内的不同说话人能得到更好的分离。该模型以有监督方式进行链接预测训练,通过最小化精炼嵌入构建的亲和矩阵与真实邻接矩阵之间的差异来实现。随后在精炼嵌入之上应用谱聚类。我们证明,在模拟和真实会议数据上,精炼后的说话人嵌入的聚类性能均显著优于原始嵌入,且我们的系统在 NIST SRE 2000 CALLHOME 数据库上取得了当时最优结果。

关键词

引用

@article{arxiv.2005.11371,
  title  = {Speaker diarization with session-level speaker embedding refinement using graph neural networks},
  author = {Jixuan Wang and Xiong Xiao and Jian Wu and Ranjani Ramamurthy and Frank Rudzicz and Michael Brudno},
  journal= {arXiv preprint arXiv:2005.11371},
  year   = {2020}
}

备注

ICASSP 2020 (45th International Conference on Acoustics, Speech, and Signal Processing)