中文

VIAssist: 多模态大语言模型适配视障用户

计算机视觉与模式识别 2024-04-04 v1 人工智能 机器学习

摘要

视障人士指的是在视觉感知方面存在部分或完全困难的个体。全球约有22亿人受视觉障碍影响。近期多模态大语言模型 (MLLM) 在各领域展现了惊人的能力。为帮助视障人士利用MLLM的强大视觉理解与推理能力具有必要。然而,由于捕获满足其日常需求的理想图像存在困难,视障人士难以使用MLLM。例如,目标物体未完全或部分位于图像中。本文探讨如何为视障人士提供基于MLLM的视觉问答服务。VIAssist可识别不可接受的图像并提供详细操作。最终,VIAssist可基于图像为用户查询提供可靠答案。我们的结果显示,VIAssist在BERTScore与ROUGE得分上分别高出基线0.21与0.31。

关键词

引用

@article{arxiv.2404.02508,
  title  = {VIAssist: Adapting Multi-modal Large Language Models for Users with Visual Impairments},
  author = {Bufang Yang and Lixing He and Kaiwei Liu and Zhenyu Yan},
  journal= {arXiv preprint arXiv:2404.02508},
  year   = {2024}
}

备注

Accepted to IEEE International Workshop on Foundation Models for Cyber-Physical Systems & Internet of Things (FMSys 2024)