中文

AViLA:用于流式多模态数据交互的异步视觉-语言智能体

计算机视觉与模式识别 2025-06-24 v1

摘要

理想的视觉-语言智能体应作为人类用户与其周围物理世界之间桥梁,广泛应用于自动驾驶和具身智能体等实际场景,能够基于用户意图提供准确且及时的响应。在智能体以动态数据流与用户的即时查询交互的情境下,�现出一种挑战:即查询与其支持证据的到达时间通常是异步的,智能体需要基于历史数据、当前观测甚至未来数据流来 grounding 其响应。我们将这一挑战定义为查询-证据异步(Query-Evidence Asynchrony),即在流式环境中,用户查询及其支持证据通常以异步方式到达。该设置不仅需要强大的推理能力,还需要保留过去观测并具备时序意识来响应查询。本文提出了一个诊断基准,评估多模态大语言模型(MLLM)在处理流式数据交互方面的能力。进一步,我们提出了AViLA——面向流式数据交互的异步视频-语言智能体,能够处理即时查询并给出时序感知的响应。为此,AViLA由三个关键模块构成:综合记忆保留、证据识别和证据 grounding 触发器,旨在维护通用记忆并及时响应查询。我们的实验表明,现有模型常常无法在恰当时机作出响应,而AViLA显著提升了准确率和时序意识。我们的代码和数据集将对公众开放。

关键词

引用

@article{arxiv.2506.18472,
  title  = {AViLA: Asynchronous Vision-Language Agent for Streaming Multimodal Data Interaction},
  author = {Gengyuan Zhang and Tanveer Hannan and Hermine Kleiner and Beste Aydemir and Xinyu Xie and Jian Lan and Thomas Seidl and Volker Tresp and Jindong Gu},
  journal= {arXiv preprint arXiv:2506.18472},
  year   = {2025}
}

备注

preprint version; 23 pages (including references and appendix)