中文

OmniInteract:面向实时全模态助手的流式交互基准

计算机视觉与模式识别 2026-05-27 v1 计算与语言

摘要

我们介绍 OmniInteract,一个用于实时全模态大型语言模型的流式基准,通过原生在线推理评估音视频流。不同于离线视频理解或文本提示下的流式问答,OmniInteract 保存原始音视频流,要求模型在线处理,无法访问未来内容。用户查询和环境声音嵌入音频轨道,要求模型检测多模态触发器、决定何时作答,并在流经过程中进行回答。OmniInteract 包含 250 个视频,1,430 个时空标记化的响应槽:1,062 个 1Q1A 槽位覆盖实时、主动和嵌套场景,368 个 1QnA 槽位用于连续任务监控和步骤指导。每个槽位包括触发器、响应窗口和目标答案。我们评估响应正确性、时机、无效输出、中断处理和上下文连续性,使用 Interaction-Aware Quality-Timeliness F1、Interruption Diagnostic Suite 和 Nested Chain Completion Score。实验表明,当前模型在流式交互方面仍显薄弱,最佳的整体 IA-QTF1 仅达 0.368,最佳的 1QnA IA-QTF1 仅达 0.052。进一步研究表明,在全双工环境中的数学推理显示,离线能力不一定能转化为在线交互。代码和数据集将公开访问于 https://github.com/Lucky-Lance/OmniInteract。

关键词

引用

@article{arxiv.2605.26485,
  title  = {OmniInteract: Benchmarking Real-World Streaming Interaction for Real-Time Omnimodal Assistants},
  author = {Xudong Lu and Xueying Li and Annan Wang and Yang Bo and Jinpeng Chen and Zengliang Li and Nianzu Yang and Rui Liu and Xue Yang and Jingwen Hou and Hongsheng Li},
  journal= {arXiv preprint arXiv:2605.26485},
  year   = {2026}
}