中文

Describe Now:面向盲人与低视力用户的用户驱动音频描述

人机交互 2025-05-29 v2

摘要

音频描述 (AD) 通过描述无法从主音轨中理解的视觉元素,使视频对盲人与低视力 (BLV) 用户变得无障碍。由专业人士或新手描述员创建的 AD 非常耗时,并且几乎不为 BLV 观众提供关于描述长度、内容以及接收时机的定制或控制。为了填补这一空白,我们探索了用户驱动的 AI 生成描述,使 BLV 观众能够控制他们接收描述的时机和细节程度。在一项研究中,20 名 BLV 参与者对七种不同视频类型触发了两个细节级别的音频描述:简明和详细。我们的发现揭示了不同视频对 AD 的偏好频率和细节级别的差异、参与者对这种 AD 交付方式的控制感及其局限性。我们讨论了这些发现对未来面向 BLV 用户的 AD 工具开发的启示。

关键词

引用

@article{arxiv.2411.11835,
  title  = {Describe Now: User-Driven Audio Description for Blind and Low Vision Individuals},
  author = {Maryam Cheema and Hasti Seifi and Pooyan Fazli},
  journal= {arXiv preprint arXiv:2411.11835},
  year   = {2025}
}

备注

17 pages, 14 figures