理解生成场景描述的视觉与语言模型中的跨模态交互
计算与语言
2022-11-11 v2 计算机视觉与模式识别
摘要
图像描述模型往往以对象为中心的方式描述图像,强调可见对象。但图像描述也可以脱离对象,描述所描绘场景的类型。在本文中,我们探索了最先进的视觉与语言模型 VinVL 在场景级别描述图像的潜力,使用了(1)一个将图像与以对象为中心的描述和场景描述配对的新颖数据集。通过对微调效果的(2)深入分析,我们表明(3)少量精选数据足以生成场景描述,同时不丧失识别场景中对象级概念的能力;与生成以对象为中心的描述相比,该模型获得了更为整体的图像视角。我们讨论了这些结果与计算和认知科学中关于场景感知研究的见解之间的相似之处。
引用
@article{arxiv.2211.04971,
title = {Understanding Cross-modal Interactions in V&L Models that Generate Scene Descriptions},
author = {Michele Cafagna and Kees van Deemter and Albert Gatt},
journal= {arXiv preprint arXiv:2211.04971},
year = {2022}
}