中文

VEDIT:用于程序化视频表示学习的潜在预测架构

计算机视觉与模式识别 2024-10-07 v1 机器学习

摘要

程序化视频表示学习是活跃的研究领域,目标是学习一个智能体能够在给定当前视频输入的情况下预测并预见未来,通常结合文本注释。以前的工作常常依赖大规模预训练的视觉编码器和具有语言监督的预测模型。然而,以计算密集型预训练来学习带有噪声文本监督的视频片段序列的必要性和有效性尚未得到之前工作的充分验证。在本工作中,我们表明,一个强大的即插即用冻结预训练视觉编码器,配合精心设计的预测模型,即可在无需预训练预测模型或来自语言或 ASR 的额外监督的情况下,在预测和程序化规划方面实现最先进 (SoTA) 水平。我们的方法不从像素空间学习表示,而是利用公开可用的视觉编码器的潜在嵌入空间。通过以来自观察步骤的冻结 clip 级别嵌入为条件来预测未见步骤的动作,我们的预测模型能够通过迭代去噪学习鲁棒的表示进行预测——利用最近在扩散变换器方面的进展 (Peebles & Xie, 2023)。在总计5个程序化学习任务跨越4个数据集 (NIV、CrossTask、COIN 和 Ego4D-v2) 的经验研究表明,我们的模型在长期动作预期 (+2.6% 在 Verb ED@20, +3.1% 在 Noun ED@20) 中超越了强大的基线,在步骤预测 (+5.0%)、任务分类 (+3.8%) 和程序规划任务中显著改进了 SoTA (在成功率 +2.28%、mAcc +3.39% 和 mIoU +0.90%)。

关键词

引用

@article{arxiv.2410.03478,
  title  = {VEDIT: Latent Prediction Architecture For Procedural Video Representation Learning},
  author = {Han Lin and Tushar Nagarajan and Nicolas Ballas and Mido Assran and Mojtaba Komeili and Mohit Bansal and Koustuv Sinha},
  journal= {arXiv preprint arXiv:2410.03478},
  year   = {2024}
}

备注

10 pages