中文

VideoA11y:面向视障用户的可访问视频描述的方法与数据集

计算机视觉与模式识别 2025-03-03 v1 人机交互

摘要

视频描述对盲人和低视力用户至关重要,使其能够获取视觉内容。然而,当前人工智能模型在生成描述时常常不足,因为训练数据集中人工标注质量有限,导致生成的描述未能完全满足盲人和低视力用户的需求。为此,我们提出 VideoA11y 方法,利用多模态大语言模型(MLLMs)和视频可访问性指南,生成针对盲人和低视力用户的定制化描述。通过该方法,我们构建了 VideoA11y-40K 数据集,这是目前规模最大、最全面的包含 40,000 个视频的数据集,专为盲人和低视力用户描述而设计。我们在 15 个视频类别上进行了严格实验,涉及 347 名正常视力参与者、40 名盲人和低视力参与者以及 7 名专业描述员,实验结果显示,VideoA11y 生成的描述在清晰度、准确性、客观性、描述性和用户满意度方面均优于初学者的人工标注,并与经过训练的人工标注相当。我们使用标准指标和自定义指标对模型在 VideoA11y-40K 上的表现进行评估,证明在该数据集上微调的 MLLMs 能够生成高质量的可访问描述。代码和数据集已提供于 https://people-robots.github.io/VideoA11y。

关键词

引用

@article{arxiv.2502.20480,
  title  = {VideoA11y: Method and Dataset for Accessible Video Description},
  author = {Chaoyu Li and Sid Padmanabhuni and Maryam Cheema and Hasti Seifi and Pooyan Fazli},
  journal= {arXiv preprint arXiv:2502.20480},
  year   = {2025}
}

备注

ACM CHI 2025