多通道序列转序列神经说话人识别:MISP 2025 挑战的实验结果
音频与语音处理
2025-05-23 v1
摘要
本文描述了为多模态信息基础语音处理(MISP)2025挑战开发的说话人识别系统。首先,我们利用序列转序列神经说话人识别(S2SND)框架使用单通道音频生成初始预测。随后,我们将原始S2SND框架扩展创建新的多通道序列转序列神经说话人识别(MC-S2SND),其使用多通道音频细化初始结果。最终系统在比赛数据库评估集上实现了8.09%的说话人识别误差率(DER),在MISP 2025挑战说话人识别任务中获得第一名。
引用
@article{arxiv.2505.16387,
title = {Multi-Channel Sequence-to-Sequence Neural Diarization: Experimental Results for The MISP 2025 Challenge},
author = {Ming Cheng and Fei Su and Cancan Li and Juan Liu and Ming Li},
journal= {arXiv preprint arXiv:2505.16387},
year = {2025}
}
备注
Accepted by Interspeech2025