中文

超越视觉感知:来自视障用户与大型多模态模型智能手机交互的洞见

人机交互 2025-02-25 v1

摘要

大型多模态模型 (LMM) 已为视障人群 (PVI) 提供通过听觉文本接收周围环境自然语言描述的新型 AI 应用提供了可能。我们调查了这种视觉辅助新范式如何改变 PVI 完成和管理日常任务的方式。我们不仅进行了可用性评估,还探讨了 LMM 基于工具在个人和社交情境中的能力与局限性,并研究了其未来发展的设计启示。通过访谈 14 位使用 Be My AI (一种 LMM 应用程序) 的视障用户,以及分析其图像描述(来自研究参与者和社交媒体平台),我们确定了两个关键局限性。首先,这些系统的情境感知受到幻觉和对社交情境、风格及人类身份认知错误的影响。其次,它们的意图导向能力往往无法准确把握和执行用户的意图。基于这些发现,我们提出了改进人类-AI 和 AI-AI 交互的设计策略,为开发更有效、更互动且更个性化的辅助技术做出了贡献。

关键词

引用

@article{arxiv.2502.16098,
  title  = {Beyond Visual Perception: Insights from Smartphone Interaction of Visually Impaired Users with Large Multimodal Models},
  author = {Jingyi Xie and Rui Yu and He Zhang and Syed Masum Billah and Sooyeon Lee and John M. Carroll},
  journal= {arXiv preprint arXiv:2502.16098},
  year   = {2025}
}