VLGrammar:视觉与语言的接地语法归纳
计算机视觉与模式识别
2021-03-25 v1 人工智能
计算与语言
机器学习
摘要
认知语法表明,语言语法的习得是立足于视觉结构之中的。虽然语法是自然语言的一种本质表征,它也同样普遍存在于视觉中以表示层次化的部分-整体结构。在这项工作中,我们在联合学习框架中研究视觉与语言的接地语法归纳。具体而言,我们提出 VLGrammar,一种使用复合概率上下文无关文法(复合 PCFG)同时归纳语言语法与图像语法的方法。我们提出一种新颖的对比学习框架来引导两个模块的联合学习。为给接地语法归纳任务提供基准,我们收集了一个大规模数据集 \textsc{PartIt},其中包含描述 3D 物体部分级语义的人工书写句子。在 \textsc{PartIt} 数据集上的实验表明,VLGrammar 在图像语法归纳和语言语法归纳上均优于所有基线。学习到的 VLGrammar 自然有益于相关下游任务。具体而言,它将图像无监督聚类准确率提升了 30%,并在图像检索与文本检索中表现良好。值得注意的是,所归纳的语法通过轻松泛化到未见类别展现出优越的泛化能力。
引用
@article{arxiv.2103.12975,
title = {VLGrammar: Grounded Grammar Induction of Vision and Language},
author = {Yining Hong and Qing Li and Song-Chun Zhu and Siyuan Huang},
journal= {arXiv preprint arXiv:2103.12975},
year = {2021}
}