从文本视角探查跨模态语义对齐能力
计算与语言
2022-10-19 v1
摘要
近年来,视觉与语言预训练(VLP)模型在多种跨模态下游任务上推进了最优结果。跨模态语义对齐被宣称是VLP模型的基本能力之一。然而,VLP模型中对齐的内在工作机制仍不清楚。本文提出一种基于图像描述的新探查方法,首次对VLP模型的跨模态语义对齐进行实证研究。我们的探查方法基于如下事实:给定图像-描述对,VLP模型会给出一个分数,指示两种模态对齐的程度;最大化此类分数将生成VLP模型认为对齐良好的句子。因此分析这些句子将揭示不同模态以何种方式对齐以及VLP模型中这些对齐的程度。我们将探查方法应用于UNITER、ROSITA、ViLBERT、CLIP和LXMERT五个流行VLP模型,并在这些模型指导下对生成的描述提供综合分析。结果显示VLP模型:(1)更关注将物体与视觉词对齐,而忽视全局语义;(2)偏好固定句式,从而忽略流畅性与语法等更重要的文本信息;(3)认为含更多视觉词的描述与图像对齐更好。这些发现表明VLP模型在跨模态语义对齐上仍存在弱点,希望本工作能引起研究者在设计新VLP模型时对此类问题的关注。
引用
@article{arxiv.2210.09550,
title = {Probing Cross-modal Semantics Alignment Capability from the Textual Perspective},
author = {Zheng Ma and Shi Zong and Mianzhi Pan and Jianbing Zhang and Shujian Huang and Xinyu Dai and Jiajun Chen},
journal= {arXiv preprint arXiv:2210.09550},
year = {2022}
}
备注
Findings of EMNLP2022