EEND-M2F:用于说话人日志的掩码注意力掩码Transformer
声音
2024-01-24 v1 音频与语音处理
摘要
在本文中,我们建立了图像分割方法与端到端说话人日志方法之间的显式联系。基于这些见解,我们提出了一种新颖的、完全端到端的说话人日志模型 EEND-M2F,该模型基于 Mask2Former 架构。说话人表征通过一堆 Transformer 解码器并行计算,其中利用来自先前层的预测,在交叉注意力中显式地掩码掉不相关的帧。EEND-M2F 轻量、高效且真正端到端,因为它不需要运行任何额外的说话人日志、说话人验证或分割模型,也不需要运行任何聚类算法。我们的模型在多个公共数据集(如 AMI、AliMeeting 和 RAMC)上达到了最先进的性能。最值得注意的是,我们在 DIHARD-III 上 16.07% 的 DER 是对挑战赛获胜系统的首次重大改进。
引用
@article{arxiv.2401.12600,
title = {EEND-M2F: Masked-attention mask transformers for speaker diarization},
author = {Marc Härkönen and Samuel J. Broughton and Lahiru Samarakoon},
journal= {arXiv preprint arXiv:2401.12600},
year = {2024}
}
备注
14 pages, 2 figures