BLaVe-CoT:面向盲人和低视力用户的一致性感知视觉问答
计算机视觉与模式识别
2025-09-09 v1
摘要
视觉问答(VQA)在帮助盲人和低视力(BLV)用户方面具有巨大潜力,但实际应用仍富有挑战性。由于视力受损,BLV 用户常常拍摄模糊或构图不当的照片,并难以表达关于他们看不到的内容的具体问题。结果是,他们的视觉问题常常含糊不清,不同用户可能对它们有不同的解释。这导致存在多个有效答案,每个答案都基于不同的图像区域——这与传统 VQA 系统的假设(即单个答案和区域)不符。为弥合这一差距,我们提出了 BLaVe-CoT,一个针对ambiguity情境下的 VQA 框架,旨在推理答案的一致性。我们的方法使用经过 LoRA 微调的 BLIP-2 模型提出多样化的候选答案,然后使用 PolyFormer 对每个答案进行空间定位,最后应用链式思考推理模块来评估这些答案是指 refer to 相同的还是不同的区域。在 VQA-AnswerTherapy 数据集上评估后,BLaVe-CoT 在准确率和对ambiguity 和视觉噪声的鲁棒性方面均优于先前方法。该工作凸显了 VQA 系统需要适应真实人类不确定性并为 BLV 用户提供包容性支持的需求。为促进进一步的研究和可访问性应用,我们已在 https://github.com/Accecwan/BLaVe-CoT 上公开代码。
引用
@article{arxiv.2509.06010,
title = {BLaVe-CoT: Consistency-Aware Visual Question Answering for Blind and Low Vision Users},
author = {Wanyin Cheng and Zanxi Ruan},
journal= {arXiv preprint arXiv:2509.06010},
year = {2025}
}