中文

面向盲人和低视力用户的轻量级视觉语言模型与自定义 LLM 评估的可及性

计算机视觉与模式识别 2025-11-14 v1 计算与语言

摘要

大型视觉语言模型(VLMs)在理解和生成视频描述方面表现卓越,但其高内存、计算需求以及部署要求制约了实际应用,尤其是对于依赖详细、情境感知描述的盲人和低视力(BLV)用户。为研究模型规模对可及性导向描述质量的影响,本文评估了 SmolVLM2 变体,参数分别为 5 亿和 22 亿,分别在两个多样化数据集上进行测试:AVCaps(户外)和 Charades(室内)。本文引入两个专为 BLV 可及性评估设计的新框架:多情境 BLV 框架,用于评估空间定位、社交互动、行动事件和氛围情境;导航辅助框架,聚焦于移动关键信息。此外,我们系统评估了四种不同的提示设计策略,并在智能手机上部署了这两个模型,评估了 FP32 和 INT8 精度变体,以衡量资源受限移动设备上的实际性能约束。

关键词

引用

@article{arxiv.2511.10615,
  title  = {Towards Blind and Low-Vision Accessibility of Lightweight VLMs and Custom LLM-Evals},
  author = {Shruti Singh Baghel and Yash Pratap Singh Rathore and Sushovan Jena and Anurag Pradhan and Amit Shukla and Arnav Bhavsar and Pawan Goyal},
  journal= {arXiv preprint arXiv:2511.10615},
  year   = {2025}
}

备注

8 pages