Vid2Coach:将教学视频转化为任务助手
人机交互
2025-07-28 v2 计算机视觉与模式识别
摘要
人们使用视频学习新食谱、锻炼和手工艺。然而,这类视频依赖视觉比较,盲人和低视力(BLV)人群难以跟随。我们观察到视觉康复治疗师(VRT)指导 BLV 人群跟随教学视频时,VRT 提供了主动和响应式支持,包括详细描述、非视觉变通方法和进度反馈。我们提出 Vid2Coach,一种将教学视频转化为可穿戴相机助手的系统,提供无障碍指令和混合主动反馈。Vid2Coach 从视频中生成无障碍指令,通过用演示细节和每一步的完成标准来增强旁白指令。随后,它使用检索增强生成从 BLV 专用资源中提取相关的非视觉变通方法。Vid2Coach 随后利用嵌入商用智能眼镜中的相机监控用户进度,以提供情境感知指令、主动反馈和用户问题解答。使用 Vid2Coach 的 BLV 参与者(N=8)在完成烹饪任务时,比使用其常规工作流时减少了 58.5% 的错误,并希望在日常生活中使用 Vid2Coach。Vid2Coach 展示了 AI 视觉辅助的机会,即增强而非取代非视觉专业知识。
引用
@article{arxiv.2506.00717,
title = {Vid2Coach: Transforming How-To Videos into Task Assistants},
author = {Mina Huh and Zihui Xue and Ujjaini Das and Kumar Ashutosh and Kristen Grauman and Amy Pavel},
journal= {arXiv preprint arXiv:2506.00717},
year = {2025}
}
备注
Accepted to UIST 2025 Project website: https://minahuh.com/Vid2Coach/