中文

AdaVid:自适应视频语言预训练

计算机视觉与模式识别 2025-04-18 v1 人工智能

摘要

对比式视频语言预训练在学习丰富且稳健的视频表征方面取得了很大成功。然而,在计算受限的边缘设备上部署此类视频编码器仍然具有挑战性 due to其高计算需求。此外,现有模型通常仅处理短视频片段,常受限于 4 到 64 帧。本文介绍 AdaVid,一个灵活的架构框架,旨在学习高效视频编码器,使其能够根据可用资源动态调整其计算资源占用。AdaVid 的核心是一个自适应 transformer 模块,灵感来自 Matryoshka Representation Learning,允许模型在推理时调整其隐藏嵌入维度。我们展示,AdaVid-EgoVLP 在使用仅半数计算资源的情况下,就能匹配标准 EgoVLP 在短视频语言基准任务上的性能,当给定相同计算资源时甚至能超越 EgoVLP。我们进一步探讨了帧数与计算量之间的权衡,在具有挑战性的 Diving48 分类基准上,表明 AdaVid 使我们能够在不超过计算限制的情况下使用更多帧。为了处理更长的视频,我们还提出了一个轻量级层次网络,用于聚合短片段特征,在多个长视频基准上实现了计算效率与准确性之间的强大平衡。

关键词

引用

@article{arxiv.2504.12513,
  title  = {AdaVid: Adaptive Video-Language Pretraining},
  author = {Chaitanya Patel and Juan Carlos Niebles and Ehsan Adeli},
  journal= {arXiv preprint arXiv:2504.12513},
  year   = {2025}
}

备注

CVPRW 2025. Project Page: https://chaitanya100100.github.io/AdaVid/