通过图像到文本迁移实现更好的文本理解
计算与语言
2017-06-02 v2 计算机视觉与模式识别
机器学习
摘要
通用文本嵌入已成功应用于多种任务。然而,它们通常是通过从纯文本语料库中捕获共现结构来学习的,这导致其泛化能力存在局限性。在本文中,我们探索了将视觉信息融入文本表示的模型。基于全面的消融研究,我们提出了一种概念简单但性能优异的架构。它在一系列成熟的基准测试上优于以往的多模态方法。我们还改进了图像相关文本数据集上的 SOTA 结果,且使用的数据量少了数个数量级。
引用
@article{arxiv.1705.08386,
title = {Better Text Understanding Through Image-To-Text Transfer},
author = {Karol Kurach and Sylvain Gelly and Michal Jastrzebski and Philip Haeusser and Olivier Teytaud and Damien Vincent and Olivier Bousquet},
journal= {arXiv preprint arXiv:1705.08386},
year = {2017}
}