中文

面向密集视频字幕的层次紧凑记忆建模 HiCM$^2$

计算机视觉与模式识别 2024-12-20 v1

摘要

随着对解决现实世界视频挑战的需求增长,对密集视频字幕 (DVC) 的兴趣日益上升。DVC 涉及自动为未裁剪视频生成字幕和定位。多个研究突出了 DVC 的挑战,提出改进方法利用先验知识,如预训练和外部记忆。本研究提出一种模型,利用受人类记忆层次和认知启发的先验知识。为模拟人类式记忆召回,我们构建层次记忆和层次记忆读取模块。通过对记忆事件进行聚类并使用大语言模型进行总结,我们构建高效的层次紧凑记忆。比较实验表明,这一层次记忆召回过程通过在 YouCook2 和 ViTT 数据集上实现最先进性能,显著提升了 DVC 的性能。

关键词

引用

@article{arxiv.2412.14585,
  title  = {HiCM$^2$: Hierarchical Compact Memory Modeling for Dense Video Captioning},
  author = {Minkuk Kim and Hyeon Bae Kim and Jinyoung Moon and Jinwoo Choi and Seong Tae Kim},
  journal= {arXiv preprint arXiv:2412.14585},
  year   = {2024}
}

备注

AAAI2025