从教学视频生成多模态子任务图
机器学习
2023-02-20 v1 人工智能
计算与语言
计算机视觉与模式识别
摘要
现实世界的任务由多个相互依赖的子任务组成(例如,脏锅需要先清洗才能用于烹饪)。在这项工作中,我们旨在从描述该任务的教学视频中建模此类子任务之间的因果依赖关系。这是一个具有挑战性的问题,因为关于世界的完整信息通常无法从视频中获取,这需要鲁棒的学习机制来理解事件的因果结构。我们提出多模态子任务图生成(MSG2),一种从含噪声的网络视频中构建子任务图的方法,该图定义了与任务相关的各子任务之间的依赖关系。与先前方法相比,我们的多模态方法生成的图更接近于人工标注的图。MSG2在ProceL和CrossTask数据集上分别比最近的视频Transformer模型在下游子任务预测任务中准确率高85%和30%。
引用
@article{arxiv.2302.08672,
title = {Multimodal Subtask Graph Generation from Instructional Videos},
author = {Yunseok Jang and Sungryull Sohn and Lajanugen Logeswaran and Tiange Luo and Moontae Lee and Honglak Lee},
journal= {arXiv preprint arXiv:2302.08672},
year = {2023}
}