通过图片学习语言
计算与语言
2015-06-22 v2
摘要
我们提出 Imaginet,一种从耦合的文本和视觉输入中学习语言的视觉基础表示的模型。该模型由两个共享词嵌入的门控循环单元 (Gated Recurrent Unit) 网络组成,并通过接收场景的文本描述并试图同时预测其视觉表示和句子中的下一个词来使用多任务目标。模仿人类语言学习的一个重要方面,它从视觉场景描述中获取单个词的意义表示。此外,它学会在多层词短语的语义解释中有效使用顺序结构。
引用
@article{arxiv.1506.03694,
title = {Learning language through pictures},
author = {Grzegorz Chrupała and Ákos Kádár and Afra Alishahi},
journal= {arXiv preprint arXiv:1506.03694},
year = {2015}
}
备注
To appear at ACL 2015