利用过程性知识与任务层次结构进行高效的教学视频预训练
计算机视觉与模式识别
2025-02-25 v1
摘要
教学视频提供了一种学习新任务(例如烹饪食谱或组装家具)的便捷模态。观众希望找到既能反映他们感兴趣的整体任务,又包含他们执行该任务所需相关步骤的对应视频。为此,教学视频模型应能够推断输入视频中发生的任务和步骤。在计算资源或用于训练该模型的相关视频主题有限的情况下,高效且具备泛化能力地完成这一工作至关重要。为满足这些要求,我们显式地挖掘任务层次结构以及与教学视频相关联的过程性步骤。我们使用这些先验知识来预训练我们的模型 ,用于步骤和任务预测。在预训练期间,我们还提供视频增强和提前停止策略,以最佳地确定用于下游任务的模型。我们在两个下游数据集上测试了该预训练模型在任务识别、步骤识别和步骤预测任务上的表现。当预训练数据和计算资源有限时,我们在这些任务上优于先前的基线。因此,利用先前的任务和步骤结构能够实现对 的高效训练,以用于教学视频推荐。
引用
@article{arxiv.2502.17352,
title = {Leveraging Procedural Knowledge and Task Hierarchies for Efficient Instructional Video Pre-training},
author = {Karan Samel and Nitish Sontakke and Irfan Essa},
journal= {arXiv preprint arXiv:2502.17352},
year = {2025}
}
备注
12 pages, 3 figures