基于空间增强的序列到序列神经说话人识别框架用于会议场景
音频与语音处理
2026-03-10 v2
摘要
本文提出一种基于空间增强的序列到序列神经网络说话人识别框架(SA-S2SND),将由SRP-DNN估计得到的到达方向(DOA)线索集成到S2SND模型主干中。采用两阶段训练策略:首先使用单通道音频和DOA特征进行训练,随后在DOA引导下使用多通道输入进一步优化。在此基础上,本文引入一种模拟DOA生成方案,以缓解对匹配多通道语料的依赖。在AliMeeting数据集上,SA-S2SND相较于S2SND基线模型表现一致,离线模式下实现了7.4%的相对DER降低,结合通道注意力机制后实现了超过19%的提升。这些结果表明,空间线索在跨通道建模中具有高度互补性,在线上和离线模式下均能获得良好性能。
关键词
引用
@article{arxiv.2510.09505,
title = {Spatially-Augmented Sequence-to-Sequence Neural Diarization for Meetings},
author = {Li Li and Ming Cheng and Juan Liu and Ming Li},
journal= {arXiv preprint arXiv:2510.09505},
year = {2026}
}
备注
Submitted to Interspeech 2026