中文

面向 Web 无障碍的上下文感知图像描述

人机交互 2024-09-06 v1

摘要

盲人和低视力 (BLV) 互联网用户通过文本描述访问网页上的图像。诸如 GPT-V、Gemini 和 LLaVa 等新型视觉到语言模型现在可以按需提供详细的图像描述。尽管先前的研究和指南指出 BLV 受众的信息偏好取决于图像的上下文,但现有的用于访问视觉到语言模型的工具仅提供无上下文的图像描述,即仅针对图像本身生成描述而不考虑周围的网页上下文。为了探索如何将图像上下文整合到图像描述中,我们设计了一款 Chrome 扩展程序,该程序可自动提取网页上下文以为 GPT-4V 生成的图像描述提供信息。我们在一项用户研究中获得了 12 名 BLV 参与者的反馈,比较了典型的无上下文图像描述与上下文感知图像描述。随后,我们通过技术评估进一步评估了我们的上下文感知图像描述。我们的用户评估表明,BLV 参与者通常更倾向于上下文感知描述而非无上下文描述。BLV 参与者还认为上下文感知描述在质量、可想象性、相关性和合理性方面的评分显著更高。所有参与者均表示希望在未来使用上下文感知描述,并强调了其在在线购物、社交媒体、新闻和个人兴趣博客中的使用潜力。

关键词

引用

@article{arxiv.2409.03054,
  title  = {Context-Aware Image Descriptions for Web Accessibility},
  author = {Ananya Gubbi Mohanbabu and Amy Pavel},
  journal= {arXiv preprint arXiv:2409.03054},
  year   = {2024}
}

备注

17 pages, 11 figures