面向视频局部化指令生成的高效预训练
计算机视觉与模式识别
2024-07-23 v4 人工智能
计算与语言
机器学习
摘要
以食谱演示为代表的过程性视频在传达逐步指令方面非常有用。然而,理解此类视频具有挑战性,因为它涉及步骤的精确定位与文本指令的生成。人工标注步骤并撰写指令成本高昂,这限制了当前数据集的规模并阻碍了有效学习。利用大规模但含噪的视频-转录文本数据集进行预训练可以提升性能,但需要大量计算资源。此外,转录文本包含无关内容,且在风格上不同于人工撰写的指令。为缓解这些问题,我们提出一种新技术 Sieve-&-Swap,用于自动生成食谱领域的高质量训练数据:(i) Sieve(筛选):过滤无关转录文本;(ii) Swap(替换):通过用纯文本食谱数据集中的人工撰写指令替换转录文本来获取高质量文本。所得数据集比当前的网页规模数据集小三个数量级,但能够实现大规模模型的高效训练。除 Sieve-&-Swap 外,我们提出 Procedure Transformer (ProcX),一种用于过程性视频端到端步骤定位与指令生成的模型。当在我们的精选数据集上预训练时,该模型在使用极少训练数据的情况下,在 YouCook2 和 Tasty 上取得了最先进的性能。我们已发布代码与数据集。
引用
@article{arxiv.2311.15964,
title = {Efficient Pre-training for Localized Instruction Generation of Videos},
author = {Anil Batra and Davide Moltisanti and Laura Sevilla-Lara and Marcus Rohrbach and Frank Keller},
journal= {arXiv preprint arXiv:2311.15964},
year = {2024}
}
备注
ECCV 2024