中文

面向盲人和低视力人群的多模态大语言模型:基于视觉问题的主动视觉解释导向

计算机视觉与模式识别 2025-10-03 v1 人工智能 人机交互

摘要

多模态大语言模型(MLLMs)已集成到视觉解释应用中,以支持盲人和低视力(BLV)用户,因其准确性和能够提供丰富、类似人类的解释能力。然而,这些应用往往默认进行全面、冗长的描述,忽略上下文,导致交换效率低下,用户必须穿越无关细节才能获得所需的特定信息。为提供更具上下文相关性的信息,我们开发了一个系统,利用历史 BLV 用户提问。当给定图像时,系统从 VizWiz-LF 数据集中识别相似的过去视觉上下文,并使用关联提问来指导 MLLM 生成更符合 BLV 用户需求的描述。通过对三个人类标注员对 92 条上下文感知和上下文无关描述进行修订的评估显示,上下文感知描述在 76.1%(共 70 例)的案例中预测并回答了用户提问,且在 54.4%(共 50 例)的比较中被偏好。我们的论文及数据分析已公开于 https://github.com/rgonzalezp/guiding-multimodal-large-language-models-with-blind-and-low-vision-people-visual-questions。

关键词

引用

@article{arxiv.2510.01576,
  title  = {Guiding Multimodal Large Language Models with Blind and Low Vision People Visual Questions for Proactive Visual Interpretations},
  author = {Ricardo Gonzalez Penuela and Felipe Arias-Russi and Victor Capriles},
  journal= {arXiv preprint arXiv:2510.01576},
  year   = {2025}
}

备注

7 pages, 2 figure, 2 tables, CV4A11y Workshop at ICCV 2025