中文

Structure-CLIP:面向场景图知识以增强多模态结构化表示

计算与语言 2023-12-14 v3 人工智能 多媒体

摘要

大规模视觉-语言预训练在多模态理解与生成任务中取得了显著性能。然而,现有方法在需要结构化表示(即对象、属性和关系的表示)的图像-文本匹配任务上往往表现不佳。如图~reffig:case (a) 所示,模型无法区分“一名宇航员骑一匹马”与“一匹马骑一名宇航员”。这是因为它们在多模态场景中学习表示时未能充分利用结构化知识。在本文中,我们提出一个端到端框架 Structure-CLIP,其集成了场景图知识(SGK)以增强多模态结构化表示。首先,我们使用场景图引导语义负例的构建,从而加强对结构化表示学习的关注。此外,提出一种知识增强编码器(KEE),将 SGK 作为输入以进一步增强结构化表示。为验证所提框架的有效性,我们使用上述方法预训练模型并在下游任务上开展实验。实验结果表明,Structure-CLIP 在 VG-Attribution 和 VG-Relation 数据集上达到了最先进的(SOTA)性能,分别领先多模态 SOTA 模型 12.5% 和 4.1%。同时,MSCOCO 上的结果表明 Structure-CLIP 在保持通用表示能力的同时显著增强了结构化表示。我们的代码可在 https://github.com/zjukg/Structure-CLIP 获取。

关键词

引用

@article{arxiv.2305.06152,
  title  = {Structure-CLIP: Towards Scene Graph Knowledge to Enhance Multi-modal Structured Representations},
  author = {Yufeng Huang and Jiji Tang and Zhuo Chen and Rongsheng Zhang and Xinfeng Zhang and Weijie Chen and Zeng Zhao and Zhou Zhao and Tangjie Lv and Zhipeng Hu and Wen Zhang},
  journal= {arXiv preprint arXiv:2305.06152},
  year   = {2023}
}

备注

AAAI 2024, https://github.com/zjukg/Structure-CLIP