你还记得吗?基于跨模态记忆检索的密集视频描述
计算机视觉与模式识别
2024-04-12 v1
摘要
密集视频描述的研究已受到广泛关注,其目标是在未裁剪的视频中自动定位并描述所有事件。一些研究通过将密集视频描述设计为事件定位和事件描述的多任务问题来引入方法,以考虑任务间关系。然而,由于缺乏语义内容,仅使用视觉输入来处理这两个任务具有挑战性。在本研究中,我们通过提出一种受人类认知信息处理启发的新颖框架来解决这个问题。我们的模型利用外部记忆来整合先验知识。提出了一种基于跨模态视频到文本匹配的记忆检索方法。为了有效整合检索到的文本特征,设计了具有视觉和文本交叉注意力模块的多功能编码器和解码器。通过对比实验,在ActivityNet Captions和YouCook2数据集上展示了所提方法的有效性。实验结果表明,我们的模型在没有从大型视频数据集进行大量预训练的情况下,表现出了有前景的性能。
引用
@article{arxiv.2404.07610,
title = {Do You Remember? Dense Video Captioning with Cross-Modal Memory Retrieval},
author = {Minkuk Kim and Hyeon Bae Kim and Jinyoung Moon and Jinwoo Choi and Seong Tae Kim},
journal= {arXiv preprint arXiv:2404.07610},
year = {2024}
}
备注
CVPR 2024