IPIBench:面向连续流环境下MLLMs交互式主动智能评估
计算机视觉与模式识别
2026-05-27 v1
摘要
最近的多模态大语言模型(MLLMs)在反应式问答方面取得了显著成绩,但实际应用中的流式助理需要对持续的视觉输入进行主动推理。现有基准主要研究反应式或主动交互于孤立单轮情形下,忽略了用户可在交错的反应查询中添加、修改或取消主动请求的动态多轮情形。为填补这一空白,我们引入IPIBench,即用于评估MLLMs在流式视频情形下交互式主动智能的首个基准。IPIBench涵盖主动监控、主动任务管理及交错反应-主动请求。对代表性MLLMs进行评估揭示了两个主要局限:主动触发不稳定且反应-主动行为之间的协调能力弱。我们进一步提出IPI-Agent,一个无训练的智能体框架,采用交互控制策略和时序门控机制,以稳定主动触发并协调多轮交互。实验表明,IPI-Agent在所有基准情形下均显著性地提升现有MLLMs的性能。
引用
@article{arxiv.2605.27074,
title = {IPIBench: Evaluating Interactive Proactive Intelligence of MLLMs under Continuous Streams},
author = {Jinzhao Li and Yinuo Chen and Wenxuan Song and Yijia Lei and Yichi Zhang and Honglei Yan and Panwang Pan and Miao Liu},
journal= {arXiv preprint arXiv:2605.27074},
year = {2026}
}