MISP 2025 挑战:基于多模态信息的语音处理
声音
2025-05-28 v2 人工智能
音频与语音处理
摘要
会议是语音应用中宝贵但具有挑战性的场景,由于复杂的声学条件。本文总结了MISP 2025挑战的结果,该挑战于2025年Interspeech会议期间举办,旨在通过融合视频模态于音频之外,实现多设备、多模态会议转录。任务包括音视频说话人话语分割(Audio-Visual Speaker Diarization, AVSD)、音视频语音识别(Audio-Visual Speech Recognition, AVSR)以及音视频话语分割与识别(Audio-Visual Diarization and Recognition, AVDR)。我们介绍了挑战的目标、任务、数据集、基线系统以及参赛者提出的解决方案。最佳系统相较于基线显著提升:顶级AVSD模型实现了8.09%的话语分割误差率(Diarization Error Rate, DER),提升了7.43%;顶级AVSR系统实现了9.48%的字符误差率(Character Error Rate, CER),提升了10.62%;最佳AVDR系统实现了连接式最小排列字符误差率(concatenated minimum-permutation Character Error Rate, cpCER)为11.56%,提升了72.49%。
关键词
引用
@article{arxiv.2505.13971,
title = {The Multimodal Information Based Speech Processing (MISP) 2025 Challenge: Audio-Visual Diarization and Recognition},
author = {Ming Gao and Shilong Wu and Hang Chen and Jun Du and Chin-Hui Lee and Shinji Watanabe and Jingdong Chen and Siniscalchi Sabato Marco and Odette Scharenborg},
journal= {arXiv preprint arXiv:2505.13971},
year = {2025}
}
备注
Accepted by Interspeech 2025. Camera-ready version