中文

FullTransNet:用于视频摘要的具有局部-全局注意力的全 Transformer

计算机视觉与模式识别 2025-08-08 v2

摘要

视频摘要旨在生成原始视频的紧凑、信息丰富且具有代表性的概要,这对于浏览、分析和理解视频内容至关重要。视频摘要中的主流方法主要依赖循环或卷积神经网络,以及最近基于纯编码器的 Transformer 架构。然而,这些方法在并行性、建模长程依赖以及提供显式生成能力方面通常存在若干局限性。为了解决这些问题,我们提出了一种名为 FullTransNet 的类 Transformer 架构,包含两个方面的设计。首先,它使用具有编码器-解码器结构的全 Transformer 作为视频摘要的替代架构。由于全 Transformer 专门为序列转导任务设计,将其直接应用于视频摘要既直观又有效。其次,它用局部和全局稀疏注意力的组合取代了标准的全注意力机制,使模型能够捕获长程依赖,同时显著降低计算成本。这种局部-全局稀疏注意力仅应用于计算量集中的编码器端,进一步提高了效率。在两个广泛使用的基准数据集 SumMe 和 TVSum 上的大量实验表明,我们的模型分别实现了 54.4% 和 63.9% 的 F-score,同时保持了相对较低的计算和内存需求。这些结果分别比次优方法高出 0.1% 和 0.3%,验证了 FullTransNet 的有效性和效率。

关键词

引用

@article{arxiv.2501.00882,
  title  = {FullTransNet: Full Transformer with Local-Global Attention for Video Summarization},
  author = {Libin Lan and Lu Jiang and Tianshu Yu and Xiaojuan Liu and Zhongshi He},
  journal= {arXiv preprint arXiv:2501.00882},
  year   = {2025}
}

备注

15 pages, 8 figures, 4 tables; The code is at https://github.com/ChiangLu/FullTransNet