ShapeGlot:用于形状区分的语言学习
计算与语言
2019-05-09 v1 计算机视觉与模式识别
摘要
在这项工作中,我们探究了常见物体形状的细粒度差异如何在语言中得到表达,并以物体的图像和3D模型为 grounding。我们首先构建了一个大规模、精心控制的人类话语数据集,其中每个话语都指代一个3D CAD模型的2D渲染图,以将其与一组形状相似的可选对象区分开来。利用该数据集,我们开发了神经语言理解(听)和生成(说)模型,这些模型在 grounding 方式(通过point-cloud的纯3D形式 vs. 渲染的2D图像)、所捕获的语用推理程度(例如是否推理听者的说话者)以及神经架构(例如是否带注意力机制)上有所不同。我们发现这些模型在与合成及人类伙伴、以及面对未出现的话语和物体时均表现良好。我们还发现这些模型适用于对新物体类别的零样本迁移学习(例如从在椅子上的训练迁移到在灯具上的测试),以及适用于从家具目录中提取的真实世界图像。损伤研究表明,神经听者严重依赖于部件相关词,并将这些词与物体的视觉部件正确关联(无需任何关于物体部件的网络显式训练),且当已知部件词可用时,向新类别的迁移最为成功。本工作展示了一种实用的语言 grounding 方法,并提供了关于物体形状与语言结构在物体区分方面关系的案例研究。
引用
@article{arxiv.1905.02925,
title = {ShapeGlot: Learning Language for Shape Differentiation},
author = {Panos Achlioptas and Judy Fan and Robert X. D. Hawkins and Noah D. Goodman and Leonidas J. Guibas},
journal= {arXiv preprint arXiv:1905.02925},
year = {2019}
}