中文

记忆巩固实现长上下文视频理解

计算机视觉与模式识别 2024-06-03 v2

摘要

大多数基于 Transformer 的视频编码器由于其二次复杂度而局限于短时序上下文。尽管已有各种尝试来扩展此上下文,但这通常以增加概念和计算复杂度为代价。我们提出换一种方式,通过简单地微调现有的预训练视频 Transformer,使其关注从过去激活中非参数化导出的记忆,从而对其进行重新利用。通过利用冗余减少,我们的记忆巩固视觉 Transformer (MC-ViT) 轻松将其上下文扩展至遥远的过去,并在从更长视频中学习时展现出优异的缩放行为。在此过程中,MC-ViT 在 EgoSchema、Perception Test 和 Diving48 上的长上下文视频理解任务中创下了新的 SOTA,超越了受益于多数量级参数的方法。

关键词

引用

@article{arxiv.2402.05861,
  title  = {Memory Consolidation Enables Long-Context Video Understanding},
  author = {Ivana Balažević and Yuge Shi and Pinelopi Papalampidi and Rahma Chaabouni and Skanda Koppula and Olivier J. Hénaff},
  journal= {arXiv preprint arXiv:2402.05861},
  year   = {2024}
}