中文

Omni-DuplexEval:评估实时双工全模态交互

计算机视觉与模式识别 2026-05-19 v1

摘要

实时双工交互对于在真实世界场景中运行的多模态 AI 系统至关重要,模型必须持续处理流式输入并在适当的时刻做出响应。然而,大多数现有的多模态大语言模型 (MLLM) 是在离线设置下评估的,即在生成任何响应之前处理整个视频输入。虽然最近的工作开始探索实时双工 MLLM,但针对这种设置仍然没有全面的基准或自动评估方法。为了填补这一空白,我们提出了 Omni-DuplexEval,一个用于系统评估实时双工交互的基准。该基准包含两个互补的场景:(1) 实时描述,评估生成连续的、时间对齐的响应以跟踪不断演变的多模态输入的能力,以及 (2) 主动提醒,评估识别显著事件并在适当时刻做出响应的能力。Omni-DuplexEval 包含 660 个带有细粒度人工标注和精确时间元数据的视频,涵盖 9 个基于真实世界场景的任务,其中所有问题都被表述为开放式查询。我们进一步引入了一个基于 LLM-as-a-Judge 的自动评估框架,该框架通过时间戳感知和顺序推理联合评估响应内容对齐和响应时机,实现了系统性评估,并与人类判断达成了高度一致。在 SOTA 双工 MLLM 上的实验揭示了重大的局限性。表现最好的模型总体仅达到 39.6%,而在主动提醒上仅得分 20.0%。我们的分析指出了两个关键挑战:模型难以在及时响应与连贯、整体的内容生成之间取得平衡,并且它们通常无法确定何时响应以及生成什么内容。我们希望我们的工作能促进 MLLM 的进一步发展。

关键词

引用

@article{arxiv.2605.17360,
  title  = {Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction},
  author = {Chaoqun He and Mingyang Xiang and Yingjing Xu and Bokai Xu and Junbo Cui and Jie Zhou and Yuan Yao and Lijie Wen},
  journal= {arXiv preprint arXiv:2605.17360},
  year   = {2026}
}

备注

22 pages, 6 figures