基于图的句子概括的密集视频字幕
计算机视觉与模式识别
2025-06-26 v1 人工智能
摘要
最近的密集视频字幕方法在检测和描述长无剪辑视频中的所有事件方面取得了令人鼓舞的进展.尽管取得了良好结果,但大多数现有方法未充分探索事件时间提案内的场景演变,因此在场景和对象在相对较长的提案中发生变化时表现不佳.为此,我们提出了一种基于图的分区-概括(GPaS)框架用于密集视频字幕,包含两个阶段.在"分区"阶段,将整个事件提案分割成更细粒度的短视频段进行描述.在"概括"阶段,将为每个片段生成的包含丰富描述信息的句子概括为一条描述整个事件的句子.我们特别关注"概括"阶段,提出一种有效利用语义词之间关系的框架.我们通过将语义词作为图中的节点,利用视觉线索结合图卷积网络(GCN)和长短期记忆网络(LSTM)学习其相互作用来实现此目标.提出了两种 GCN-LSTM 交互(GLI)模块,以实现 GCN 和 LSTM 的无缝集成.通过在 ActivityNet Captions 数据集和 YouCook II 数据集上与最先进的方法进行广泛比较,证明了我们方法的有效性.
引用
@article{arxiv.2506.20583,
title = {Dense Video Captioning using Graph-based Sentence Summarization},
author = {Zhiwang Zhang and Dong Xu and Wanli Ouyang and Luping Zhou},
journal= {arXiv preprint arXiv:2506.20583},
year = {2025}
}
备注
12 pages