多模态大语言模型能否提供实时逐步任务指导?
计算机视觉与模式识别
2026-04-14 v2
摘要
多模态大型语言模型(LLM)在对话能力方面取得了显著进展,但在提供实时、交互式的逐步指导方面仍存在挑战,这也是未来AI助手所必需的关键能力。有效的指导不仅需要提供指令,还需要检测指令的成功执行,以及识别并警报用户错误,所有这些都必须在实时内完成。这要求模型具备非轮次式的特性,能够对视频流进行异步响应,同时能够处理显示用户执行任务(包括错误及其纠正)的视频数据。为此,我们引入了 Qualcomm Interactive Cooking,一个新的基准数据集,基于 CaptainCook4D 构建,其中包含用户在任务执行过程中的错误。我们的数据集和基准特征包括密集标注、带时间戳的指令和反馈消息,特别包括精确标注错误警报的时间戳,以其在视频中的视觉发生位置为准。我们在Qualcomm Interactive Cooking 基准上评估了最先进的多模态 LLM,并引入了LiveMamba,一个用于交互式指令指导的流式多模态 LLM。本工作为开发和评估实时、情境化的教练提供了第一个专门基准和强大的基线。
引用
@article{arxiv.2511.21998,
title = {Can Multi-Modal LLMs Provide Live Step-by-Step Task Guidance?},
author = {Apratim Bhattacharyya and Bicheng Xu and Sanjay Haresh and Reza Pourreza and Litian Liu and Sunny Panchal and Pulkit Madan and Leonid Sigal and Roland Memisevic},
journal= {arXiv preprint arXiv:2511.21998},
year = {2026}
}
备注
Accepted to NeurIPS 2025 (Project page: https://apratimbh.github.io/livecook)