IRIS:基于推理时视线移动的开放式视觉问答意图解析
计算机视觉与模式识别
2026-05-06 v2
摘要
我们提出IRIS(Intent Resolution via Inference-time Saccades),一种新颖的无训练方法,通过实时眼动数据解决开放式视觉问答中的歧义问题。通过对500个独特图像-问题对的全面用户研究,我们展示,最接近参与者开始口头提问时间的凝视点是消除歧义最有信息量的点,能够将模糊问题的回答准确率从35.2%提升至77.2%,同时保持对无歧义查询的性能。我们在多种最先进的视觉语言模型上评估了该方法,显示在集成眼动数据后,针对模糊图像-问题对的表现均有一致性提升,无论架构差异如何。我们发布了一个新的基准数据集,用于眼动数据实现消除歧义的视觉问答,一个新颖的实时交互协议,以及一个评估套件。
引用
@article{arxiv.2602.16138,
title = {IRIS: Intent Resolution via Inference-time Saccades for Open-Ended VQA in Large Vision-Language Models},
author = {Parsa Madinei and Srijita Karmakar and Russell Cohen Hoffing and Felix Gervitz and Miguel P. Eckstein},
journal= {arXiv preprint arXiv:2602.16138},
year = {2026}
}