acknowledgment Focus Ambiguity in Visual Questions
计算机视觉与模式识别
2025-08-01 v2
摘要
没有任何已发表的工作在视觉问题 answering(VQA)中考虑问题内容在图像中位置的歧义。为填补这一空白,我们引入 VQ-FocusAmbiguity,第一个能够在图像中 visually ground 每一个 plausible image region 的 VQA 数据集,以便在获得有效答案时问题可能指涉的每个区域。我们随后分析并比较了该数据集与现有数据集,以揭示其独特属性。最后,我们对现代模型进行基准测试,以针对 acknowledgment focus ambiguity 相关的两个新任务进行测试:识别视觉问题是否存在焦点歧义以及定位图像中所有 plausible focus 区域。结果表明,该数据集对现代模型具有挑战性。为促进这些任务的未来进展,我们在 https://vizwiz.org/tasks-and-datasets/focus-ambiguity-in-visual-questions 上公开分享了该数据集并提供了评估服务器。
引用
@article{arxiv.2501.02201,
title = {Acknowledging Focus Ambiguity in Visual Questions},
author = {Chongyan Chen and Yu-Yun Tseng and Zhuoheng Li and Anush Venkatesh and Danna Gurari},
journal= {arXiv preprint arXiv:2501.02201},
year = {2025}
}