面向盲人和低视力人群的多模态大语言模型:基于视觉问题的主动视觉解释导向
计算机视觉与模式识别
2025-10-03 v1 人工智能
人机交互
摘要
多模态大语言模型(MLLMs)已集成到视觉解释应用中,以支持盲人和低视力(BLV)用户,因其准确性和能够提供丰富、类似人类的解释能力。然而,这些应用往往默认进行全面、冗长的描述,忽略上下文,导致交换效率低下,用户必须穿越无关细节才能获得所需的特定信息。为提供更具上下文相关性的信息,我们开发了一个系统,利用历史 BLV 用户提问。当给定图像时,系统从 VizWiz-LF 数据集中识别相似的过去视觉上下文,并使用关联提问来指导 MLLM 生成更符合 BLV 用户需求的描述。通过对三个人类标注员对 92 条上下文感知和上下文无关描述进行修订的评估显示,上下文感知描述在 76.1%(共 70 例)的案例中预测并回答了用户提问,且在 54.4%(共 50 例)的比较中被偏好。我们的论文及数据分析已公开于 https://github.com/rgonzalezp/guiding-multimodal-large-language-models-with-blind-and-low-vision-people-visual-questions。
引用
@article{arxiv.2510.01576,
title = {Guiding Multimodal Large Language Models with Blind and Low Vision People Visual Questions for Proactive Visual Interpretations},
author = {Ricardo Gonzalez Penuela and Felipe Arias-Russi and Victor Capriles},
journal= {arXiv preprint arXiv:2510.01576},
year = {2025}
}
备注
7 pages, 2 figure, 2 tables, CV4A11y Workshop at ICCV 2025