中文

通过结构时空对齐增强视频语言表示

计算机视觉与模式识别 2024-06-28 v1 计算与语言

摘要

虽然大规模视频语言模型(VLM)的预训练在各种下游视频语言任务中显示出巨大的潜力,但现有的VLM仍可能 suffer from certain commonly seen limitations, 例如粗糙的跨模态对齐、对时间动态的低估、以及视频语言视角的脱节。在本工作中,我们针对增强VLM,提出一种细粒度结构时空对齐学习方法(称为Finsta)。首先,我们将输入的文本和视频表示为细粒度场景图(SG)结构,两者进一步统一为整体SG(HSG),以桥接两种模态。然后,构建基于SG的框架,其中文本SG(TSG)采用图Transformer进行编码,而视频动态SG(DSG)和HSG则采用新颖的循环图Transformer进行空间和时间特征传播。进一步设计了一种时空高斯微分图Transformer,以强化对象在空间和时间维度上的变化感知。基于TSG和DSG的细粒度结构特征,我们分别执行对象中心的空间对齐和谓词中心的时序对齐,增强视频语言在空间性和时间性上的 grounding 能力。我们将方法设计为即插即用系统,可集成到现有的已训练VLM中进行进一步表示增强,而无需从头训练或依赖下游应用中的SG标注。在6个代表性VL建模任务的12个数据集上(涵盖标准场景和长形式视频场景),Finsta持续改进了13个表现良好的VLM,显著提升了当前在微调和零样本设置下的SOTA性能。

关键词

引用

@article{arxiv.2406.19255,
  title  = {Enhancing Video-Language Representations with Structural Spatio-Temporal Alignment},
  author = {Hao Fei and Shengqiong Wu and Meishan Zhang and Min Zhang and Tat-Seng Chua and Shuicheng Yan},
  journal= {arXiv preprint arXiv:2406.19255},
  year   = {2024}
}

备注

Accepted by IEEE TPAMI 2024