鸡尾酒局基准:多模态数据集与比较评估结果
计算与语言
2026-02-13 v2
摘要
我们提出了名为Multi-Modal Context-Aware Recognition(MCoRec)的任务,这是第九届CHiME挑战中的一个新任务,旨在解决单房间环境中重叠对话的鸡尾酒问题,利用音频、视觉及语境线索。MCoRec捕捉自然的多方对话场景,其中录音聚焦于非剧本化、随意的群体聊天,导致最高可达100%的语音重叠及高度碎片化的对话轮次。该任务要求系统回答“谁何时说话、说了什么、与谁对话”的问题,通过从音视频录制中对每个说话者的语音进行联合转录并聚类到其各自对话中。音频单模态基线的词错误率超过100%,而纳入视觉信息可实现约50%的显著提升,凸显了多模态的重要性。本文概述了该任务的动机、数据收集过程及用于MCoRec的基线系统。
引用
@article{arxiv.2510.23276,
title = {A Cocktail-Party Benchmark: Multi-Modal dataset and Comparative Evaluation Results},
author = {Thai-Binh Nguyen and Katerina Zmolikova and Pingchuan Ma and Ngoc Quan Pham and Christian Fuegen and Alexander Waibel},
journal= {arXiv preprint arXiv:2510.23276},
year = {2026}
}
备注
Accepted at ICASSP 2026