Describe Now:面向盲人与低视力用户的用户驱动音频描述
人机交互
2025-05-29 v2
摘要
音频描述 (AD) 通过描述无法从主音轨中理解的视觉元素,使视频对盲人与低视力 (BLV) 用户变得无障碍。由专业人士或新手描述员创建的 AD 非常耗时,并且几乎不为 BLV 观众提供关于描述长度、内容以及接收时机的定制或控制。为了填补这一空白,我们探索了用户驱动的 AI 生成描述,使 BLV 观众能够控制他们接收描述的时机和细节程度。在一项研究中,20 名 BLV 参与者对七种不同视频类型触发了两个细节级别的音频描述:简明和详细。我们的发现揭示了不同视频对 AD 的偏好频率和细节级别的差异、参与者对这种 AD 交付方式的控制感及其局限性。我们讨论了这些发现对未来面向 BLV 用户的 AD 工具开发的启示。
引用
@article{arxiv.2411.11835,
title = {Describe Now: User-Driven Audio Description for Blind and Low Vision Individuals},
author = {Maryam Cheema and Hasti Seifi and Pooyan Fazli},
journal= {arXiv preprint arXiv:2411.11835},
year = {2025}
}
备注
17 pages, 14 figures