中文

基于场景图的细粒度对齐SegCaptioning Transformer用于可控视频分割与描述

计算机视觉与模式识别 2026-03-24 v1

摘要

最近的多模态大模型发展显著缩小了不同模态表征之间的差距,催化了视频多模态解释的演变,这种演变通过生成相关模态来增强用户对视频内容的理解。然而,大多数现有视频多模态解释方法主要集中于全局理解,用户交互有限。为此,我们提出了一种新任务,可控视频分割与描述(SegCaptioning),允许用户提供特定提示(例如围绕感兴趣目标的边界框),以同时生成与用户意图高度吻合的掩码和描述。我们设计了一种创新框架场景图引导的细粒度SegCaptioning Transformer(SG-FSCFormer),该框架集成了基于提示的时序图Transformer,通过自适应提示适配器有效捕获和表示用户意图,确保生成内容与用户要求高度一致。此外,本模型引入了细粒度掩码-语言解码器,通过多实体对比损失协同预测高质量的描述-掩码对,并为每个掩码及其相应描述标记提供细粒度对齐,从而增强用户对视频的理解。在两个基准数据集上的全面实验表明,SG-FSCFormer在各项指标上均实现了卓越的性能,有效捕获用户意图并生成针对用户具体要求的精准多模态输出。我们的代码已公开于https://github.com/XuZhang1211/SG-FSCFormer。

关键词

引用

@article{arxiv.2603.20887,
  title  = {Scene Graph-guided SegCaptioning Transformer with Fine-grained Alignment for Controllable Video Segmentation and Captioning},
  author = {Xu Zhang and Jin Yuan and BinHong Yang and Xuan Liu and Qianjun Zhang and Yuyi Wang and Zhiyong Li and Hanwang Zhang},
  journal= {arXiv preprint arXiv:2603.20887},
  year   = {2026}
}

备注

12 pages, 6 figures