通过多模态部分对齐的接地语言学习利用视觉信息扩展 BERT 表示
计算与语言
2024-01-10 v2
摘要
在现有的视觉接地语言学习研究中,语言模型同时通过纯语言目标和视觉接地进行监督。然而,由于视觉接地数据集和语言语料库在分布和规模上存在差异,语言模型倾向于混淆出现在接地数据中的词元的上下文与未出现的词元。因此,在表示学习过程中,视觉信息与句子的上下文含义之间存在不匹配。为克服这一局限,我们提出了 GroundedBERT——一种通过视觉接地信息增强 BERT 表示的接地语言学习方法。GroundedBERT 包含两个组件:(i) 原始的 BERT,用于捕获从语言语料库中学到的词的上下文表示;(ii) 一个视觉接地模块,用于捕获从视觉接地数据集中学习到的视觉信息。此外,我们采用最优传输(OT),特别是其部分变体,以解决两种模态之间的部分对齐问题。我们所提出的方法在 GLUE 和 SQuAD 数据集上的各种语言任务中显著优于基线语言模型。
引用
@article{arxiv.2312.01592,
title = {Expand BERT Representation with Visual Information via Grounded Language Learning with Multimodal Partial Alignment},
author = {Cong-Duy Nguyen and The-Anh Vu-Le and Thong Nguyen and Tho Quan and Luu Anh Tuan},
journal= {arXiv preprint arXiv:2312.01592},
year = {2024}
}