评估语言与视觉模型的表示中枢
计算与语言
2019-04-15 v1 计算机视觉与模式识别
摘要
在计算语言学与计算机视觉交叉的新兴领域中,多模态模型实现了认知科学中提出的“Hub and Spoke”架构的自下而上处理过程,以表征大脑如何处理与融合多感官输入。具体而言,该 Hub 被实现为神经网络编码器。我们研究了文献中提出的各种视觉与语言任务对该编码器的影响:视觉问答、视觉指代消解以及视觉基础对话。为了衡量编码器所学表示的质量,我们使用了两种分析。首先,我们在一个现有的、旨在评估多模态语义理解的诊断任务上,评估了在不同视觉与语言任务上预训练的编码器。其次,我们进行了一系列分析,旨在研究编码器如何融合和利用这两种模态。
引用
@article{arxiv.1904.06038,
title = {Evaluating the Representational Hub of Language and Vision Models},
author = {Ravi Shekhar and Ece Takmaz and Raquel Fernández and Raffaella Bernardi},
journal= {arXiv preprint arXiv:1904.06038},
year = {2019}
}
备注
Accepted to IWCS 2019