VideoMix:聚合任务导向视频用于学习
人机交互
2025-03-28 v1 计算机视觉与模式识别
摘要
教程视频是人们学习新技能的宝贵资源。人们通常通过观看多个教程视频来获取对任务的整体理解,这些视频提供了实现该任务的不同方法。然而,浏览多个视频可能耗时且沮丧,因为这些视频分散且难以快速浏览。我们提出了 VideoMix 系统,帮助用户通过聚合多个关于同一任务的视频信息,获得对如何完成任务的整体理解。我们的形式化研究 (N=12) 揭示,学习者重视理解潜在结果、所需材料、备选方法以及不同视频共享的重要细节。基于 Vision-Language 模型管道,VideoMix 提取并组织这些信息,呈现简洁的文本摘要并配以相关视频片段,使用户能够快速消化和浏览内容。对比用户研究 (N=12) 表明,VideoMix 使参与者比基准视频界面(视频独立观看)更高效地获得了更全面的任务理解。我们的发现凸显了围绕共享目标组织视频的任务导向、多视频方法的潜力,为传统视频学习提供了更好的替代方案。
引用
@article{arxiv.2503.21130,
title = {VideoMix: Aggregating How-To Videos for Task-Oriented Learning},
author = {Saelyne Yang and Anh Truong and Juho Kim and Dingzeyu Li},
journal= {arXiv preprint arXiv:2503.21130},
year = {2025}
}
备注
In Proceedings of the 30th International Conference on Intelligent User Interfaces (IUI '25) 2025