WearVQA:面向佩戴式设备的视觉问答基准测试
人工智能
2025-12-03 v2
摘要
我们介绍WearVQA,这是首个专为评估多模态AI助手在佩戴式设备(如智能眼镜)上的视觉问答能力而设计的基准测试。与先前聚焦于高质量第三人称图像的基准测试不同,WearVQA反映了以人体中心为导向的交互特点——视觉输入可能被遮挡、光线不足、无法变焦或模糊,且问题植根于真实可行的佩戴式使用场景。该基准测试包含2520个精心挑选的图像-问题-答案三元组,覆盖7个多样化的图像领域(包括文本导向和通用场景),10种认知任务类型(从基本识别到各种推理),以及6种常见的佩戴式图像质量问题。所有问题都旨在仅依赖视觉输入和常识即可解答。WearVQA配备了严格的LLM评判框架,标注准确率达96%。开源和专有多模态LLM在WearVQA上的QA准确率最低可达24-52%,在图像质量较低和推理密集型任务上表现显著下降。这些观察结果将WearVQA定位为引导技术进步,致力于构建稳健、面向实际应用的多模态佩戴式AI系统的全面且具挑战性的基准测试。
引用
@article{arxiv.2511.22154,
title = {WearVQA: A Visual Question Answering Benchmark for Wearables in Egocentric Authentic Real-world scenarios},
author = {Eun Chang and Zhuangqun Huang and Yiwei Liao and Sagar Ravi Bhavsar and Amogh Param and Tammy Stark and Adel Ahmadyan and Xiao Yang and Jiaqi Wang and Ahsan Abdullah and Giang Nguyen and Akil Iyer and David Hall and Elissa Li and Shane Moon and Nicolas Scheffer and Kirmani Ahmed and Babak Damavandi and Rakesh Wanga and Anuj Kumar and Rohit Patel and Xin Luna Dong},
journal= {arXiv preprint arXiv:2511.22154},
year = {2025}
}
备注
11 pages, 5 figures, NeurIPS 2025