理解盲人与低视力人群对支持 MLLM 的视觉解读应用的使用
人机交互
2025-03-11 v1 人工智能
摘要
盲人与低视力 (BLV) 人群已开始采用 AI 驱动的视觉解读应用来满足其日常需求。虽然这些应用很有帮助,但先前的研究发现,用户对其频繁的错误仍感到不满意。最近,多模态大语言模型 (MLLM) 被集成到视觉解读应用中,并展现出了提供更具描述性视觉解读的潜力。然而,这一进步如何改变了人们对这些应用的使用仍然未知。为了填补这一空白,我们进行了一项为期两周的日记研究,20 名 BLV 人士使用了我们开发的支持 MLLM 的视觉解读应用,我们收集了 553 条记录。在本文中,我们报告了对 6 名参与者的 60 条日记记录的初步分析。我们发现,参与者认为该应用的视觉解读是值得信任的(满分 5 分,平均 3.75 分)且令人满意的(满分 5 分,平均 4.15 分)。此外,参与者在接收医疗剂量建议等高风险场景中信任我们的应用。我们讨论了完成分析的计划,以期为未来支持 MLLM 的视觉解读系统的设计提供参考。
引用
@article{arxiv.2503.05899,
title = {Towards Understanding the Use of MLLM-Enabled Applications for Visual Interpretation by Blind and Low Vision People},
author = {Ricardo E. Gonzalez Penuela and Ruiying Hu and Sharon Lin and Tanisha Shende and Shiri Azenkot},
journal= {arXiv preprint arXiv:2503.05899},
year = {2025}
}
备注
8 pages, 1 figure, 4 tables, to appear at CHI 2025