面向盲人和低视力人群的大型视觉语言模型生成场景描述偏好研究
计算机视觉与模式识别
2026-04-02 v3 人工智能
摘要
对于盲人和低视力(BLV)人群而言,导航复杂环境可能构成严重风险。大型视觉语言模型(LVLMs)显示出为BLV用户生成场景描述的潜力,但其效果尚未得到探索。为填补这一空白,我们对8名BLV参与者进行用户研究,系统评估了六种类型LVLMs描述的偏好。虽然这些描述有助于降低恐惧感并提高可操作性,但用户评分显示在充分性和简洁性方面存在较大差异。此外,尽管GPT-4o在细化描述方面具有强大潜力,但并非始终被参与者首选。我们利用从用户研究中获得的见解构建训练数据,以构建新的自动评估指标,有效捕捉BLV偏好。我们的发现凸显了迫切需要BLV导向的评估指标以及人类在环反馈,以推动LVLMs描述质量在可访问性方面的进步。
引用
@article{arxiv.2502.14883,
title = {How Blind and Low-Vision Individuals Prefer Large Vision-Language Model-Generated Scene Descriptions},
author = {Na Min An and Eunki Kim and Wan Ju Kang and Sangryul Kim and James Thorne and Hyunjung Shim},
journal= {arXiv preprint arXiv:2502.14883},
year = {2026}
}
备注
This paper has been superseded by version 2 of arXiv:2510.00766