中文

Cut to the Chase: Training-free Multimodal Summarization via Chain-of-Events

计算机视觉与模式识别 2026-03-09 v1 人工智能

摘要

多模态求摘要 (MMS) 旨在通过理解和整合视频、文本和图像之间的信息,生成简洁的文本摘要。然而,现有方法仍面临三个主要挑战:(1) 依赖于特定领域的监督,(2) 隐式融合且跨模态对齐不足,(3) 缺乏事件转折的平面时序建模。为此,我们引入 **CoE**,一个无需训练的 MMS 框架,通过 **Chain-of-Events** 对结构化推理进行引导。层次化事件图 (HEG) 将文本语义编码为显式事件层级,从而搭建跨模态对齐和时序推理的框架。受此结构指导,**CoE** 在视觉特征定位、事件演化和因果转折建模方面发挥作用,并通过轻量级风格适配实现领域对齐。大量实验表明,**CoE** 在八个多样化数据集上均优于最先进的视频 CoT 基线,ROUGE 提升 **+3.04**、CIDEr 提升 **+9.51**、BERTScore 提升 **+1.88**,凸显其鲁棒性、可解释性和跨域泛化能力。我们的代码已公开于 https://github.com/youxiaoxing/CoE。

关键词

引用

@article{arxiv.2603.06213,
  title  = {Cut to the Chase: Training-free Multimodal Summarization via Chain-of-Events},
  author = {Xiaoxing You and Qiang Huang and Lingyu Li and Xiaojun Chang and Jun Yu},
  journal= {arXiv preprint arXiv:2603.06213},
  year   = {2026}
}

备注

Accepted to CVPR 2026