学习视觉基础句子表示
计算与语言
2018-06-06 v2 计算机视觉与模式识别
摘要
我们引入了多种在有监督图像描述语料库上训练的模型,以预测给定描述的图像特征,从而执行句子表示的基础化。我们训练了一个基础化句子编码器,它在 COCO 描述和图像检索上取得了良好的性能,随后表明该编码器可以成功迁移到各种 NLP 任务中,且性能优于纯文本模型。最后,我们分析了基础化的贡献,并表明该系统学习到的词嵌入优于非基础化的词嵌入。
引用
@article{arxiv.1707.06320,
title = {Learning Visually Grounded Sentence Representations},
author = {Douwe Kiela and Alexis Conneau and Allan Jabri and Maximilian Nickel},
journal= {arXiv preprint arXiv:1707.06320},
year = {2018}
}
备注
Published at NAACL-18