ViDscribe:基于多模态 AI 的在线视频音频描述定制化与问答
人机交互
2026-03-17 v1
摘要
多模态大语言模型的进步使得自动视频叙述和问答(VQA)成为可能,为盲人和低视力(BLV)观众提供可规模化的替代方案,取代依赖人工编写的音频描述(ADs)。然而,现有的 AI 生成的 AD 系统很少能够适应 BLV 个人在不同视频中的多样化需求与偏好,且通常仅在受控的单次实验环境中进行评估。我们提出了 ViDscribe,一个集成 AI 生成的 AD 以及六种用户定制化选项和针对 YouTube 视频的对话式 VQA 接口的 Web 平台。通过对八名 BLV 参与者进行的纵向、野外研究,我们检验了用户如何随时间参与定制化和 VQA 功能。我们的结果显示,用户对这两项功能保持持续的参与度,并且定制化的 AD 相对于默认的 AD 在有效性、愉悦感和沉浸感方面均有所提升,凸显了针对 BLV 用户的个性化、交互式视频访问的价值。
引用
@article{arxiv.2603.14662,
title = {ViDscribe: Multimodal AI for Customizing Audio Description and Question Answering in Online Videos},
author = {Maryam Cheema and Sina Elahimanesh and Pooyan Fazli and Hasti Seifi},
journal= {arXiv preprint arXiv:2603.14662},
year = {2026}
}
备注
CHI EA 2026