ViSpeak:流式视频中的视觉指令反馈
计算机视觉与模式识别
2025-03-18 v1
摘要
最近的大型多模态模型 (LMM) 研究主要聚焦于离线视频理解。相较之下,流式视频理解因其时序敏感、全模态和交互式特征,给最新模型带来了巨大挑战。本文从新的视角扩展流式视频理解,提出一种新任务——视觉指令反馈,要求模型具备感知视觉内容并从中提取指令的能力。例如,当用户挥手致意给智能体时,智能体应识别该手势并启动包含欢迎信息的对话。因此,基于视觉模态遵循指令可显著提升用户与智能体之间的交互。为促进研究,我们定义了七个与视觉模态高度相关的关键子任务,并收集了用于训练的 ViSpeak-Instruct 数据集以及用于评估的 ViSpeak-Bench。进一步,我们提出了 ViSpeak 模型,这是一个在各种流式视频理解基准测试中达到 GPT-4o 水平性能的 SOTA 流式视频理解 LMM。经过在 ViSpeak-Instruct 数据集上的微调后,ViSpeak 具备了基本的视觉指令反馈能力,为后续研究奠定了坚实的基线。
引用
@article{arxiv.2503.12769,
title = {ViSpeak: Visual Instruction Feedback in Streaming Videos},
author = {Shenghao Fu and Qize Yang and Yuan-Ming Li and Yi-Xing Peng and Kun-Yu Lin and Xihan Wei and Jian-Fang Hu and Xiaohua Xie and Wei-Shi Zheng},
journal= {arXiv preprint arXiv:2503.12769},
year = {2025}
}