EEND-DEMUX: 通过解复用说话人嵌入的端到端神经说话人日志
音频与语音处理
2023-12-12 v1 声音
摘要
近年来,已有研究进一步改进端到端神经说话人日志(EEND)系统。本文提出EEND-DEMUX模型,一种利用解复用说话人嵌入的新框架。在这项工作中,我们专注于在潜在空间中分离说话人相关信息,然后将每个分离的潜在变量转换为其对应的语音活动。EEND-DEMUX可以在推理阶段通过解复用操作直接获得分离的说话人嵌入,无需外部说话人日志系统、嵌入提取器或启发式解码技术。此外,我们采用多头交叉注意力机制来有效捕获混合和分离说话人嵌入之间的相关性。我们基于匹配、正交性和稀疏性约束制定了三个损失函数,以学习鲁棒的解复用说话人嵌入。在LibriMix数据集上的实验结果显示,在固定和可变说话人数场景下性能均持续提升。
引用
@article{arxiv.2312.06065,
title = {EEND-DEMUX: End-to-End Neural Speaker Diarization via Demultiplexed Speaker Embeddings},
author = {Sung Hwan Mun and Min Hyun Han and Canyeong Moon and Nam Soo Kim},
journal= {arXiv preprint arXiv:2312.06065},
year = {2023}
}
备注
Submitted to IEEE Signal Processing Letters