视觉接地神经句法习得
计算与语言
2019-09-26 v2 计算机视觉与模式识别
摘要
我们提出视觉接地神经句法学习器(VG-NSL),一种无需任何显式监督即可学习句法表示与结构的方法。该模型通过观看自然图像并阅读配对的描述文本进行学习。VG-NSL 生成文本的短语结构解析树,递归地组合各成分的表示,并将其与图像匹配。我们根据成分与图像的匹配分数定义其具体性,并用以引导文本解析。在 MSCOCO 数据集上的实验表明,VG-NSL 在不使用视觉接地的无监督解析方法中,针对黄金解析树的 F1 分数更优。我们发现 VG-NSL 对随机初始化选择与训练数据量的鲁棒性更强。我们还发现 VG-NSL 习得的具体性与语言学家定义的类似度量高度相关。最后,我们将 VG-NSL 应用于 Multi30K 数据集中的多种语言,表明我们的模型持续优于先前的无监督方法。
引用
@article{arxiv.1906.02890,
title = {Visually Grounded Neural Syntax Acquisition},
author = {Haoyue Shi and Jiayuan Mao and Kevin Gimpel and Karen Livescu},
journal= {arXiv preprint arXiv:1906.02890},
year = {2019}
}
备注
ACL 2019. Project page: https://ttic.uchicago.edu/~freda/project/vgnsl/