利用场景图将结构化表示融入预训练视觉与语言模型
计算机视觉与模式识别
2023-10-26 v2
摘要
视觉与语言模型(VLMs)在多种任务中展现出卓越的零样本(ZS)性能。然而,近期研究表明,即便是最优的 VLMs 也难以捕捉组合式场景理解的某些方面,如物体属性、关系和动作状态。相比之下,获取能够改进这些模型的结构化标注(如场景图(SGs))耗时且昂贵,因此无法大规模使用。本文探讨小型 SG 数据集是否能为增强预训练 VLMs 的结构化理解提供充足信息。我们表明,通过学习 SGs 并将融入结构化信息的组件整合进视觉与文本表示,确实可以改进 VLMs。在视觉侧,我们在图像 transformer 中引入一个专门预测 SG 信息的“SG 组件”;在文本侧,我们利用 SGs 生成突出场景不同组合方面的细粒度描述。我们的方法在多个 VL 数据集上提升了若干流行 VLMs 的性能,且仅造成 ZS 能力的轻微退化。
引用
@article{arxiv.2305.06343,
title = {Incorporating Structured Representations into Pretrained Vision & Language Models Using Scene Graphs},
author = {Roei Herzig and Alon Mendelson and Leonid Karlinsky and Assaf Arbelle and Rogerio Feris and Trevor Darrell and Amir Globerson},
journal= {arXiv preprint arXiv:2305.06343},
year = {2023}
}
备注
EMNLP 2023