视觉语言模型能否在真实世界中面对面地回答问题?
计算机视觉与模式识别
2026-02-24 v3
摘要
近年来,AI 模型在描述和回答真实世界图像相关问题方面的能力取得了显著进展。它们在使用音频输入与用户进行实时对话方面也取得了进步。这引出一个问题:我们是否已经达到了这样的阶段——连接摄像头和麦克风的 AI 模型能够针对摄像头前实时发生的场景和事件与用户进行实时对话?这长期以来一直是 AI 领域的目标,也是真实世界 AI 助手和人形机器人在日常情境中与人类交互的前提。本工作中,我们引入了一个新的数据集与基准——Qualcomm 交互式视频数据集(Interactive Video Dataset, IVD),可用于评估现有模型对这些能力的支持程度,以及通过微调能在多大程度上注入这些能力。该数据集基于一个简单的问答设置,用户提出问题,系统需基于摄像头和音频输入实时作答。我们证明现有模型在该任务上的表现远落后于人类水平,并识别了性能差距的主要来源。然而,我们也证明对于许多所需的感知技能,基于此类数据的微调能够显著缩小这一差距。
引用
@article{arxiv.2503.19356,
title = {Can Vision-Language Models Answer Face to Face Questions in the Real-World?},
author = {Reza Pourreza and Rishit Dagli and Apratim Bhattacharyya and Sunny Panchal and Guillaume Berger and Roland Memisevic},
journal= {arXiv preprint arXiv:2503.19356},
year = {2026}
}
备注
ICLR 2026 paper