中文

面向长期活动预测的多尺度视频预训练

计算机视觉与模式识别 2023-07-25 v1

摘要

长期活动预测是一个极具挑战性的研究问题,因为它需要理解已观测动作之间的时间关系,以及人类活动的可变性与复杂性。尽管最先进的预测方法依赖通过昂贵人工标注的强监督,它们通常对未见过的数据泛化能力较差。为缓解此问题,我们提出多尺度视频预训练(MVP),一种新颖的自监督预训练方法,通过学习在多个时间尺度上预测未来视频片段的上下文表征,为预测学习鲁棒表征。MVP基于我们的观察:视频中的动作具有多尺度特性,其中原子动作通常出现在短时间尺度,而更复杂的动作可能跨越更长时间尺度。我们在下游长期预测任务(包括长期动作预期和视频摘要预测)上将MVP与最先进的自监督视频学习方法进行比较。我们在Ego4D和Epic-Kitchens-55/100数据集上的综合实验表明,MVP以显著优势超越最先进方法。值得注意的是,MVP在视频摘要预测上相比现有方法取得了超过20%准确率的相对性能提升。

关键词

引用

@article{arxiv.2307.12854,
  title  = {Multiscale Video Pretraining for Long-Term Activity Forecasting},
  author = {Reuben Tan and Matthias De Lange and Michael Iuzzolino and Bryan A. Plummer and Kate Saenko and Karl Ridgeway and Lorenzo Torresani},
  journal= {arXiv preprint arXiv:2307.12854},
  year   = {2023}
}