CrossA11y:基于跨模态定位识别视频无障碍问题
人机交互
2025-02-19 v1
摘要
作者通过添加音频描述(AD)使视频在视觉上可访问,并通过添加隐藏字幕(CC)使其在听觉上可访问。然而,由于难以识别视频中的无障碍问题,创建 AD 和 CC 具有挑战性且繁琐,对非专业描述者和字幕员而言尤其如此。视频作者必须完整观看视频,并逐帧手动检查视觉与听觉两种模态中不可访问的信息。本文提出 CrossA11y,一个帮助作者高效检测并处理视频中视觉与听觉无障碍问题的系统。利用跨模态定位分析,CrossA11y 通过检查模态不对称,自动度量视频中视觉与音频片段的无障碍程度。随后,CrossA11y 在统一界面中展示这些片段并呈现视觉与音频无障碍问题,使定位、审阅、就地编写 AD/CC 以及立即预览已描述与加字幕的视频变得直观。我们通过一项有 11 名参与者的实验室研究,与现有基线进行对比,证明了 CrossA11y 的有效性。
引用
@article{arxiv.2208.11144,
title = {CrossA11y: Identifying Video Accessibility Issues via Cross-modal Grounding},
author = {Xingyu "Bruce" Liu and Ruolin Wang and Dingzeyu Li and Xiang 'Anthony' Chen and Amy Pavel},
journal= {arXiv preprint arXiv:2208.11144},
year = {2025}
}