中文

AMEGO:从长时景观视频中主动提取记忆

计算机视觉与模式识别 2024-09-18 v1

摘要

景观视频提供了对个体日常经历的独特视角,但其非结构化的特性为感知带来了挑战。本文介绍了 AMEGO,一种旨在增强对非常长时景观视频理解的新方法。灵感来自人类在单次观看中维持信息的能力,AMEGO focuses on constructing a self-contained representations from one egocentric video, capturing key locations and object interactions. 这种表示方式无需语义,能够支持多种查询,而无需重新处理整个视觉内容。此外,为评估我们对非常长时景观视频的理解能力,我们引入了新的主动记忆基准(AMB),该基准由来自 EPIC-KITCHENS 的超过 2 万个高度具有挑战性的视觉查询组成。这些查询涵盖不同的视频推理层次(排序、并发和时间定位),以评估详细的视频理解能力。我们在 AMB 上的实验结果显示,AMEGO 超越了其他视频问答基线,取得了显著的提升。

关键词

引用

@article{arxiv.2409.10917,
  title  = {AMEGO: Active Memory from long EGOcentric videos},
  author = {Gabriele Goletto and Tushar Nagarajan and Giuseppe Averta and Dima Damen},
  journal= {arXiv preprint arXiv:2409.10917},
  year   = {2024}
}

备注

Accepted to ECCV 2024. Project webpage: https://gabrielegoletto.github.io/AMEGO/