用于自然动词学习的视空间数据集
计算与语言
2020-10-30 v1
摘要
我们引入一个新的数据集,用于训练和评估具身语言模型。我们的数据收集于一个虚拟现实环境中,旨在模拟前语言阶段儿童可能接触到的语言数据质量:即自然、自发的语音与丰富具身的视空间上下文相配对。我们使用所收集的数据比较了几种用于动词分布语义模型。我们评估了基于 2D(像素)特征的神经模型以及基于 3D(符号、空间)特征的特征工程模型,结果表明两种建模途径均未达到令人满意的性能。我们的结果与来自儿童语言习得、强调从朴素分布数据中学习动词之困难性的证据相一致。我们讨论了受认知启发的具身语言学习未来工作的方向,并发布了我们的语料库以促进该主题的研究。
引用
@article{arxiv.2010.15225,
title = {A Visuospatial Dataset for Naturalistic Verb Learning},
author = {Dylan Ebert and Ellie Pavlick},
journal= {arXiv preprint arXiv:2010.15225},
year = {2020}
}
备注
9 pages, 3 figures, starsem 2020