中文

从以人物为中心的教学视频生成对话:数据集、方法与基准

计算机视觉与模式识别 2025-08-18 v1

摘要

许多日常任务(如修理器具、烹饪食谱或汽车维护)都需要专业知识,尤其是当任务复杂且需要多步骤时。尽管近年来对AI代理的兴趣日益增长,但现存缺乏以真实世界任务辅助为依据的对话视频数据集。本文提出一种简单而有效的方法,将单人教学视频转换为与细粒度步骤和视频片段对齐的双人任务指导对话。我们构建的全自动方法基于大语言模型,为人工收集数据提供了高效替代方案。通过该技术,我们构建了HowToDIV数据集,包含507个对话、6636个问答对和24小时的视频片段,覆盖烹饪、机械和园艺等多样化任务。每个会话包括多轮对话,其中专家逐步教导 novice 用户执行任务,同时通过装有摄像头和麦克风的可穿戴设备观察用户周围环境。我们使用Gemma-3模型在HowToDIV数据集上建立了基准性能,为未来在此新型任务(即用于程序任务辅助的对话)上的研究提供了基准。

关键词

引用

@article{arxiv.2508.11192,
  title  = {Generating Dialogues from Egocentric Instructional Videos for Task Assistance: Dataset, Method and Benchmark},
  author = {Lavisha Aggarwal and Vikas Bahirwani and Lin Li and Andrea Colaco},
  journal= {arXiv preprint arXiv:2508.11192},
  year   = {2025}
}