中文

从视频到对话:基于任务帮助的体视角指令

计算机视觉与模式识别 2026-02-03 v1

摘要

许多日常任务,包括家电维修、烹饪和汽车维护,都需要专业知识,尤其是对于复杂的多步骤程序。尽管对增强现实(AR)助理的人工智能代理越来越感兴趣,但由于稀缺的以真实世界任务执行为 grounding 的大规模多模态对话数据集,进展仍有限,这部分原因归因于人工收集数据成本和后勤复杂性。本文提出了一个框架,用于自动将单人 instructional 视频转换为两人之间的多模态任务指导对话。基于大型语言模型的全自动管道提供了一种可扩展且高效的传统数据收集方法的替代方案。通过该框架,我们引入 HowToDIV 数据集,包含 507 场对话、6636 条问答对,以及跨多个领域的 24 小时视频。每个会话都包含多轮专家-新手互动。最后,我们使用 Gemma 3 和 Qwen 2.5 在 HowToDIV 上报告基线结果,为多模态程序任务帮助提供初始基准。

关键词

引用

@article{arxiv.2602.01038,
  title  = {From Videos to Conversations: Egocentric Instructions for Task Assistance},
  author = {Lavisha Aggarwal and Vikas Bahirwani and Andrea Colaco},
  journal= {arXiv preprint arXiv:2602.01038},
  year   = {2026}
}