大型多模态模型 (LMM) 对视力受损者的 emerging practice:设计中的影响
人机交互
2024-07-15 v1
摘要
视力受损者感知其环境的方式是非视觉的,他们经常使用由 AI 提供支持的辅助工具以获取视觉信息的文本描述。最近基于大型视觉语言模型的 AI 辅助工具(如 Be My AI)能够更好地理解用户的自然语言查询并以可听懂的文本描述场景;然而,这些工具对视力受损用户的实际有用性目前尚未得到充分研究。本文旨在填补这一空白。我们对 14 名视力受损用户的研究揭示,他们正在有机性地适应这些工具——不仅这些工具可促进家庭、空间和社交情境中的复杂交互,而且它们也充当了用户认知的延伸,仿佛认知分布在视觉信息中。我们还发现,尽管工具目前不具目标导向性,用户仍会容忍这一局限并拥抱这些工具在更广泛用途上的能力。这些发现使我们能够设想为创建更具目标导向性、实时处理和可靠性的 AI 辅助技术设计算策影响。
引用
@article{arxiv.2407.08882,
title = {Emerging Practices for Large Multimodal Model (LMM) Assistance for People with Visual Impairments: Implications for Design},
author = {Jingyi Xie and Rui Yu and He Zhang and Sooyeon Lee and Syed Masum Billah and John M. Carroll},
journal= {arXiv preprint arXiv:2407.08882},
year = {2024}
}