中文

多通道序列转序列神经说话人识别:MISP 2025 挑战的实验结果

音频与语音处理 2025-05-23 v1

摘要

本文描述了为多模态信息基础语音处理(MISP)2025挑战开发的说话人识别系统。首先,我们利用序列转序列神经说话人识别(S2SND)框架使用单通道音频生成初始预测。随后,我们将原始S2SND框架扩展创建新的多通道序列转序列神经说话人识别(MC-S2SND),其使用多通道音频细化初始结果。最终系统在比赛数据库评估集上实现了8.09%的说话人识别误差率(DER),在MISP 2025挑战说话人识别任务中获得第一名。

关键词

引用

@article{arxiv.2505.16387,
  title  = {Multi-Channel Sequence-to-Sequence Neural Diarization: Experimental Results for The MISP 2025 Challenge},
  author = {Ming Cheng and Fei Su and Cancan Li and Juan Liu and Ming Li},
  journal= {arXiv preprint arXiv:2505.16387},
  year   = {2025}
}

备注

Accepted by Interspeech2025