中文

用于 MISP-Meeting 挑战赛视听说话人日志的交叉注意力与自注意力

声音 2025-06-04 v1

摘要

本文介绍了为多模态信息语音处理(MISP)2025 挑战赛任务 1 开发的系统。我们引入了 CASA-Net,一种专为端到端视听说话人日志(AVSD)系统设计的嵌入融合方法。CASA-Net 融合了交叉注意力(CA)模块以有效捕捉视听信号中的跨模态交互,并采用自注意力(SA)模块来学习视听帧之间的上下文关系。为进一步提升性能,我们采用了一种结合伪标签优化与重训练的训练策略,提高了时间戳预测的准确性。此外,应用中值滤波与重叠平均作为后处理技术,以消除异常值并平滑预测标签。我们的系统在评估集上实现了 8.18% 的说话人日志错误率(DER),相较于 15.52% 的基线 DER 实现了 47.3% 的相对提升。

关键词

引用

@article{arxiv.2506.02621,
  title  = {Cross-attention and Self-attention for Audio-visual Speaker Diarization in MISP-Meeting Challenge},
  author = {Zhaoyang Li and Haodong Zhou and Longjie Luo and Xiaoxiao Li and Yongxin Chen and Lin Li and Qingyang Hong},
  journal= {arXiv preprint arXiv:2506.02621},
  year   = {2025}
}