中文

基于语言引导的图表示学习用于视频摘要

计算机视觉与模式识别 2025-11-17 v1

摘要

随着社交媒体上视频内容的快速增长,视频摘要已成为多媒体处理中的关键任务。然而,现有方法面临捕捉视频内容中全局依赖关系和适应多模态用户定制的挑战。此外,视频帧之间的时间接近性并不总是对应于语义接近性。为解决这些挑战,我们提出了一种新型语言引导图表示学习网络(LGRLN)用于视频摘要。具体而言,我们引入视频图生成器,将视频帧转换为结构化图以保留时间顺序和情境依赖关系。通过构建前向图、反向图和无向图,视频图生成器有效保留了视频内容的序列性和情境关系。我们设计了基于双阈值图卷积机制的图内关系推理模块,该模块在节点之间区分语义相关帧和不相关帧。此外,我们提出的语言引导跨模态嵌入模块生成具有特定文本描述的视频摘要。我们将摘要生成输出建模为伯努利分布的混合物,并使用EM算法求解。实验结果表明,我们的方法在多个基准测试中优于现有方法。此外,我们提出的LGRLN在推理时间和模型参数上分别降低了87.8%和91.7%。我们的代码和预训练模型均可用于https://github.com/liwrui/LGRLN。

关键词

引用

@article{arxiv.2511.10953,
  title  = {Language-Guided Graph Representation Learning for Video Summarization},
  author = {Wenrui Li and Wei Han and Hengyu Man and Wangmeng Zuo and Xiaopeng Fan and Yonghong Tian},
  journal= {arXiv preprint arXiv:2511.10953},
  year   = {2025}
}

备注

Accepted by IEEE TPAMI