OmniMMI:流式视频上下文中的全面多模态交互基准
计算机视觉与模式识别
2025-04-01 v1
摘要
以GPT-4o为代表的多模态语言模型(MLLMs)的快速发展推动了全能语言模型(Omni语言模型)的进步,这类模型旨在处理并主动响应连续的多模态数据流。尽管潜力巨大,但在流式视频上下文中评估其真实世界交互能力仍是一项艰巨挑战。本文中,我们提出了OmniMMI,一个专为流式视频上下文中的OmniLLMs设计的全面多模态交互基准。OmniMMI包含超过1,121个视频和2,290个问题,针对现有视频基准中两个关键但尚未充分探索的挑战——流式视频理解与主动推理——涵盖了六个不同的子任务。此外,我们提出了一种新颖框架——多模态复用建模(M4),旨在实现一个能够边看、边听、边生成的推理高效流式模型。
引用
@article{arxiv.2503.22952,
title = {OmniMMI: A Comprehensive Multi-modal Interaction Benchmark in Streaming Video Contexts},
author = {Yuxuan Wang and Yueqian Wang and Bo Chen and Tong Wu and Dongyan Zhao and Zilong Zheng},
journal= {arXiv preprint arXiv:2503.22952},
year = {2025}
}
备注
To appear at CVPR 2025