教育性视频中视觉上下文错位:大量、可分解且不可见
人机交互
2026-05-19 v1
摘要
教育性视频是学习物理任务的主流媒介,但很少与用户实际的视觉上下文相匹配。运动仿真和认知负荷理论预言,这种不匹配应该产生影响,但我们并不知道(1)它对任务完成有多大影响,(2)哪些视觉属性负责,(3)用户如何体验它。我们进行了两种互补研究(56名参与者,86+小时,涵盖四类急救和烹饪任务),通过Wizard-of-Oz录制控制教育性视频中视觉匹配程度。在研究1中(N=16),我们准备了In-Context instructional videos(ICON)——与用户视觉感知完全匹配——与常规互联网视频进行比较。ICON实现了统计上显著的改进:完成质量提高11.1%,完成速度提高15.5%。定性分析揭示了四个负责该效应的视觉上下文属性:任务对象本质、任务对象状态、环境上下文和观察上下文。在研究2中(N=40)对每个属性进行消除,通过系统性地单独错位一个属性来验证,确认所有四个属性都产生一致的性能下降。然*我们发现,尽管单属性错位导致客观测量的明显下降,但用户却未能察觉单属性错位对任务性能的影响。视觉上下文错位是大量的、可分解的且对用户不可见的。这帮助我们理解视觉上下文不匹配的效应以及如何评估用于物理任务指导的教育性视频。
引用
@article{arxiv.2605.17184,
title = {Substantial, Decomposable, and Invisible: Visual Context Misalignment in Instructional Videos for Physical Tasks},
author = {Yayuan Li and Chenglin Li and Jingying Wang and Filippos Bellos and Anhong Guo and Jason J. Corso},
journal= {arXiv preprint arXiv:2605.17184},
year = {2026}
}
备注
14 pages, 9 figures, 2 tables