SPICA:通过增强型音频描述为盲人或低视力观众提供交互式视频内容探索
人机交互
2024-02-28 v2 多媒体
摘要
盲人或低视力(Blind or Low-Vision, BLV)用户通常依赖音频描述(audio descriptions, AD)来访问视频内容。然而,传统的静态音频描述可能会遗漏视频中的详细信息,造成较高的认知负荷,忽视 BLV 用户多样化的需求和偏好,并且缺乏沉浸感。为了应对这些挑战,我们引入了 SPICA,一个由人工智能驱动的系统,它使 BLV 用户能够交互式地探索视频内容。基于先前关于 BLV 视频消费的实证研究,SPICA 提供了新颖的交互机制,支持对帧字幕的时间导航和对关键帧内物体的空间探索。利用视听机器学习流水线,SPICA 通过增加交互性、空间音效和单个物体描述来增强现有的音频描述,而无需额外的人工标注。通过一项有 14 名 BLV 参与者参加的用户研究,我们评估了 SPICA 的可用性和有用性,并探索了用户与增强型音频描述交互时的行为、偏好和心理模型。
引用
@article{arxiv.2402.07300,
title = {SPICA: Interactive Video Content Exploration through Augmented Audio Descriptions for Blind or Low-Vision Viewers},
author = {Zheng Ning and Brianna L. Wimer and Kaiwen Jiang and Keyi Chen and Jerrick Ban and Yapeng Tian and Yuhang Zhao and Toby Jia-Jun Li},
journal= {arXiv preprint arXiv:2402.07300},
year = {2024}
}