通过场景图整合实现长视频细粒度描述
计算机视觉与模式识别
2025-07-08 v2
摘要
近期视觉语言模型的进展在图像和短视频剪辑的描述生成方面取得了显著成果。然而,这些模型受限于其有限的时序感受野,难以为长视频生成连贯且完整的描述。虽然已提出多种方法来跨视频片段聚合信息,但它们往往依赖监督式微调或计算开销巨大。为此,我们引入一种基于图整合的长视频描述新框架。该框架首先使用现成的视觉描述模型生成片段级别的描述,对应于单个帧或短视频区间。随后,将这些描述解析为 individual 场景图,并整合为保持视频全程整体上下文与细粒度细节的统一图表示。最后,轻量级的图到文本解码器生成最终的视频级别描述。该框架在不要求在长视频数据集上进行额外微调的情况下,有效扩展了现有模型的时序理解能力。实验结果表明,我们的方法在显著降低计算成本的同时,实现了对现有 LLM-based 整合方法的显著超越,展现出强大的零样本性能。
引用
@article{arxiv.2502.16427,
title = {Fine-Grained Captioning of Long Videos through Scene Graph Consolidation},
author = {Sanghyeok Chu and Seonguk Seo and Bohyung Han},
journal= {arXiv preprint arXiv:2502.16427},
year = {2025}
}
备注
Accepted to the 42nd International Conference on Machine Learning (ICML 2025)