基于多模态信息的语音处理(MISP)2023挑战赛:音视觉目标说话人提取
音频与语音处理
2023-09-18 v1 声音
摘要
此前的基于多模态信息的语音处理(MISP)挑战赛主要聚焦于音视觉语音识别(AVSR),并取得了可喜的成功。然而,最先进的后端识别系统常因复杂声学环境而遭遇性能瓶颈。这促使 MISP 2023 挑战赛(ICASSP 2024 信号处理大挑战赛)将关注点转向音视觉目标说话人提取(AVTSE)任务。与现有主要聚焦于仿真数据的音视觉语音增强挑战赛不同,MISP 2023 挑战赛独特地探索了在前端语音处理结合视觉线索的情况下,其对真实场景中后端任务的影响。这一开创性努力旨在为 AVTSE 任务设立首个基准,为在艰巨且真实的声学环境中通过 AVTSE 提升后端语音识别系统准确性提供新的见解。本文详尽概述了 MISP 2023 挑战赛的任务设定、数据集与基线系统,并深入分析了参与者可能遇到的挑战。实验结果凸显了该任务的艰巨性,我们期待参与者提出创新解决方案。
引用
@article{arxiv.2309.08348,
title = {The Multimodal Information Based Speech Processing (MISP) 2023 Challenge: Audio-Visual Target Speaker Extraction},
author = {Shilong Wu and Chenxi Wang and Hang Chen and Yusheng Dai and Chenyue Zhang and Ruoyu Wang and Hongbo Lan and Jun Du and Chin-Hui Lee and Jingdong Chen and Shinji Watanabe and Sabato Marco Siniscalchi and Odette Scharenborg and Zhong-Qiu Wang and Jia Pan and Jianqing Gao},
journal= {arXiv preprint arXiv:2309.08348},
year = {2023}
}
备注
5 pages, 4 figures