中文

基于多模态信息的语音处理(MISP)2023挑战赛:音视觉目标说话人提取

音频与语音处理 2023-09-18 v1 声音

摘要

此前的基于多模态信息的语音处理(MISP)挑战赛主要聚焦于音视觉语音识别(AVSR),并取得了可喜的成功。然而,最先进的后端识别系统常因复杂声学环境而遭遇性能瓶颈。这促使 MISP 2023 挑战赛(ICASSP 2024 信号处理大挑战赛)将关注点转向音视觉目标说话人提取(AVTSE)任务。与现有主要聚焦于仿真数据的音视觉语音增强挑战赛不同,MISP 2023 挑战赛独特地探索了在前端语音处理结合视觉线索的情况下,其对真实场景中后端任务的影响。这一开创性努力旨在为 AVTSE 任务设立首个基准,为在艰巨且真实的声学环境中通过 AVTSE 提升后端语音识别系统准确性提供新的见解。本文详尽概述了 MISP 2023 挑战赛的任务设定、数据集与基线系统,并深入分析了参与者可能遇到的挑战。实验结果凸显了该任务的艰巨性,我们期待参与者提出创新解决方案。

关键词

引用

@article{arxiv.2309.08348,
  title  = {The Multimodal Information Based Speech Processing (MISP) 2023 Challenge: Audio-Visual Target Speaker Extraction},
  author = {Shilong Wu and Chenxi Wang and Hang Chen and Yusheng Dai and Chenyue Zhang and Ruoyu Wang and Hongbo Lan and Jun Du and Chin-Hui Lee and Jingdong Chen and Shinji Watanabe and Sabato Marco Siniscalchi and Odette Scharenborg and Zhong-Qiu Wang and Jia Pan and Jianqing Gao},
  journal= {arXiv preprint arXiv:2309.08348},
  year   = {2023}
}

备注

5 pages, 4 figures