中文

从对象中心视角重新思考图像到视频适应

计算机视觉与模式识别 2024-07-10 v1

摘要

图像到视频适应旨在高效地将图像模型适用于视频领域。虽然许多图像到视频适应方法在空间模块之上采用轻量级适配器进行时序建模, 但这些尝试在效率和可解释性方面存在局限。本文从对象中心的视角提出一种新颖且高效的数据驱动方法。受人类感知启发, 人类将对象识别为视频理解的关键组件, 我们将对象发现的代理任务集成到图像到视频迁移学习中。具体而言, 我们采用带有可学习查询的 slot attention 将每帧 distilled 成一组紧凑的对象标记。这些对象中心标记随后通过对象-时间交互层来建模对象在时间上的状态变化。结合两种新的对象级损失, 我们展示了仅基于压缩后的对象中心表示即可完成高效时序推断, 而无需对视频下游任务进行额外处理。我们的方法在动作识别基准测试上实现了最先进的性能, 参数数量仅为完全微调模型的 5\%, 仅为现有高效调优方法的一半。此外, 我们的模型在无需进一步训练或对象标注的情况下在零样态视频对象分割中表现良好, 证明了对象中心视频理解的有效性。

关键词

引用

@article{arxiv.2407.06871,
  title  = {Rethinking Image-to-Video Adaptation: An Object-centric Perspective},
  author = {Rui Qian and Shuangrui Ding and Dahua Lin},
  journal= {arXiv preprint arXiv:2407.06871},
  year   = {2024}
}

备注

ECCV 2024