利用无监督语义信息的密集视频描述生成
计算机视觉与模式识别
2025-01-07 v2
摘要
我们引入一种基于以下前提学习无监督语义视觉信息的方法:复杂事件可分解为更简单的事件,且这些简单事件在多个复杂事件间共享。我们首先采用聚类方法对表示进行分组,生成视觉码本。然后,我们通过编码码本条目的共现概率矩阵来学习稠密表示。该表示在仅有视觉特征的情形下提升了密集视频描述生成任务的性能。例如,我们替换BMT方法中的音频信号,并生成性能相当的时序提议。此外,我们将视觉表示与我们的描述符在vanilla transformer方法中拼接,相较于仅探索视觉特征的方法在描述子任务上取得了最先进的性能,并与多模态方法具有竞争性表现。我们的代码可在 https://github.com/valterlej/dvcusi 获取。
引用
@article{arxiv.2112.08455,
title = {Dense Video Captioning Using Unsupervised Semantic Information},
author = {Valter Estevam and Rayson Laroca and Helio Pedrini and David Menotti},
journal= {arXiv preprint arXiv:2112.08455},
year = {2025}
}
备注
Published at Journal of Visual Communication and Image Representation