在多模态 BERT 中寻找结构知识
计算与语言
2022-03-18 v1 计算机视觉与模式识别
摘要
在这项工作中,我们研究了多模态 BERT 模型嵌入中所学到的知识。更具体地说,我们探查了它们存储语言数据的语法结构以及视觉数据中物体所学到的结构的能力。为实现这一目标,我们首先分别通过描述图像句子的依存句法分析和图像中物体区域之间的依赖关系,将语言和视觉的固有结构显式化。我们将这种显式的视觉结构称为“场景树”(scene tree),它基于语言描述的依存树。大量的探查实验表明,多模态 BERT 模型并未编码这些场景树。代码见 \url{https://github.com/VSJMilewski/multimodal-probes}。
引用
@article{arxiv.2203.09306,
title = {Finding Structural Knowledge in Multimodal-BERT},
author = {Victor Milewski and Miryam de Lhoneux and Marie-Francine Moens},
journal= {arXiv preprint arXiv:2203.09306},
year = {2022}
}
备注
Accepted at ACL 2022