盲人和低视力人群的长篇视觉问题答案
计算与语言
2025-07-28 v2 计算机视觉与模式识别
摘要
视觉语言模型现已能够生成关于图像的提问的长篇答案——长篇视觉问题答案(LFVQA)。我们贡献 VizWiz-LF,即由盲人和低视力(BLV)用户提出的视觉问题的长篇答案数据集。VizWiz-LF 包含 4200 份长篇答案,针对 600 个视觉问题,从人类专家描述者和六个 VQA 模型中收集。我们开发和标注了 LFVQA 的句子功能角色,证明长篇答案包含问答之外的信息,如解释和建议。我们进一步进行了自动和人类评估,涉及 BLV 和视力正常者,以评估长篇答案。BLV 人群认为人类撰写和生成的长篇答案都可信,但生成的答案常因幻觉而包含错误的视觉细节,尤其是针对无法回答的视觉问题(例如模糊或无关的图像)。为减少幻觉,我们评估了 VQA 模型在多种提示策略下对无法回答问题的自我回避能力。
引用
@article{arxiv.2408.06303,
title = {Long-Form Answers to Visual Questions from Blind and Low Vision People},
author = {Mina Huh and Fangyuan Xu and Yi-Hao Peng and Chongyan Chen and Hansika Murugu and Danna Gurari and Eunsol Choi and Amy Pavel},
journal= {arXiv preprint arXiv:2408.06303},
year = {2025}
}
备注
COLM 2024 Oral Spotlight