AQuA:带有视觉锚点的软件教程视频自动问答
人机交互
2024-03-11 v1
摘要
教程视频是学习功能丰富软件的热门帮助来源。然而,快速获取关于教程视频问题的答案十分困难。我们提出了一种响应教程问题的自动化方法。通过分析 5,944 条视频评论中的 633 个问题,我们识别了不同的问题类型,并观察到用户经常在问题中描述视频的某些部分。随后,我们要求参与者 (N=24) 观看教程视频并提出问题,同时用相关的视觉锚点标注视频。大多数视觉锚点指向用户界面 (UI) 元素和应用程序工作区。基于这些见解,我们构建了 AQuA,这是一个利用视觉锚点生成有用问题答案的流水线。我们以 Fusion 360 为例进行了演示,表明我们可以识别视觉锚点中的 UI 元素,并利用该视觉信息和软件文档增强的 GPT-4 生成答案。一项评估研究 (N=16) 表明,我们的方法提供的答案优于基线方法。
引用
@article{arxiv.2403.05213,
title = {AQuA: Automated Question-Answering in Software Tutorial Videos with Visual Anchors},
author = {Saelyne Yang and Jo Vermeulen and George Fitzmaurice and Justin Matejka},
journal= {arXiv preprint arXiv:2403.05213},
year = {2024}
}
备注
19 pages, CHI 2024