中文

SUPERGLASSES:面向 AI 智能眼镜的视觉语言模型基准测试

计算机视觉与模式识别 2026-04-10 v2 人工智能

摘要

AI 驱动的智能眼镜作为最热门的可穿戴设备,正在开启多模态交互的新时代,而基于外部知识源的视觉问答(VQA)正成为核心应用。现有适用于智能眼镜的视觉语言模型(VLM)通常在传统多模态数据集上进行训练和评估;然而,这些数据集缺乏足以反映智能眼镜使用场景的多样性和真实性,且与其特定挑战相背离——在准确识别感兴趣对象后,才能进行外部知识检索。为弥合这一差距,我们引入了 SUPERGLASSES——第一个完全由智能眼镜设备收集的实-world 数据构建的综合性 VQA 基准测试。SUPERGLASSES 包含 2,422 组三维图像-问答对,涵盖 14 个图像领域和 8 个查询类别,并配有完整的搜索轨迹和推理标注。我们在此基准测试中评估了 26 个代表性 VLM,发现其性能存在显著差距。为解决现有模型的局限性,我们进一步提出了 SUPERLENS——一种集成自动对象检测、查询解耦和多模态网页搜索的检索增强答生成多模态智能眼镜智能体。SUPERLENS 实现了最先进的性能,超越 GPT-4o 2.19%,凸显了在智能眼镜 VQA 中亟需针对性解决方案。本数据集已公开于 https://huggingface.co/datasets/xandery/SuperGlasses。

关键词

引用

@article{arxiv.2602.22683,
  title  = {SUPERGLASSES: Benchmarking Vision Language Models as Intelligent Agents for AI Smart Glasses},
  author = {Zhuohang Jiang and Xu Yuan and Haohao Qu and Shanru Lin and Kanglong Liu and Wenqi Fan and Qing Li},
  journal= {arXiv preprint arXiv:2602.22683},
  year   = {2026}
}