中文

通过图像到文本迁移实现更好的文本理解

计算与语言 2017-06-02 v2 计算机视觉与模式识别 机器学习

摘要

通用文本嵌入已成功应用于多种任务。然而,它们通常是通过从纯文本语料库中捕获共现结构来学习的,这导致其泛化能力存在局限性。在本文中,我们探索了将视觉信息融入文本表示的模型。基于全面的消融研究,我们提出了一种概念简单但性能优异的架构。它在一系列成熟的基准测试上优于以往的多模态方法。我们还改进了图像相关文本数据集上的 SOTA 结果,且使用的数据量少了数个数量级。

关键词

引用

@article{arxiv.1705.08386,
  title  = {Better Text Understanding Through Image-To-Text Transfer},
  author = {Karol Kurach and Sylvain Gelly and Michal Jastrzebski and Philip Haeusser and Olivier Teytaud and Damien Vincent and Olivier Bousquet},
  journal= {arXiv preprint arXiv:1705.08386},
  year   = {2017}
}