中文

记忆分板:利用时间分段进行无人驾驶视频流式自监督学习

计算机视觉与模式识别 2025-08-13 v3 机器学习

摘要

自监督学习有望从真实世界的连续未精选数据流中学习出色的表征。然而,大多数现有工作在视觉自监督学习中聚焦于静态图像或人工数据流。为探索更真实的学习基质,我们研究从长时间跨度的真实世界无人驾驶视频流中进行流式自监督学习。灵感来自人类感知和记忆中的事件分割机制,我们提出了“记忆分板”(Memory Storyboard)将最近的过去帧分组到时间段,以更有效地总结过去的视觉流以供记忆回放。为适应高效的时间分割,我们提出了两种层次的记忆结构:最近的过去存储在短期记忆中,记忆分板时间段随后转移到长期记忆中。在包括 SAYCam 和 KrishnaCam 在内的真实世界无人驾驶视频数据集上进行的实验表明,在记忆分板帧上进行的对比学习目标产生的表征在语义上具有意义,并且优于来自最先进的无监督持续学习方法所产生的表征。

关键词

引用

@article{arxiv.2501.12254,
  title  = {Memory Storyboard: Leveraging Temporal Segmentation for Streaming Self-Supervised Learning from Egocentric Videos},
  author = {Yanlai Yang and Mengye Ren},
  journal= {arXiv preprint arXiv:2501.12254},
  year   = {2025}
}

备注

Fourth Conference on Lifelong Learning Agents - CoLLAs 2025 (Oral)