中文

多模态数据集中词与主题的视觉具体性量化

计算与语言 2018-05-25 v2 计算机视觉与模式识别 信息检索

摘要

多模态机器学习算法旨在学习视觉-文本对应。先前研究表明,具有具体视觉表现的概念可能比抽象概念更易学习。我们给出一种自动计算多模态数据集中词与主题的视觉具体性的算法。我们在四种设定中应用该方法,范围从图像描述到从历史书籍中爬取的图像/文本。除了能够探索多模态数据集中的概念外,我们的具体性分数还能预测机器学习算法学习文本/视觉关系的能力。我们发现:1) 具体概念确实更易学习;2) 我们考虑的大量算法具有相似的失败案例;3) 具体性与性能之间的确切正相关关系因数据集而异。我们以使用具体性分数促进未来多模态研究的建议作结。

关键词

引用

@article{arxiv.1804.06786,
  title  = {Quantifying the visual concreteness of words and topics in multimodal datasets},
  author = {Jack Hessel and David Mimno and Lillian Lee},
  journal= {arXiv preprint arXiv:1804.06786},
  year   = {2018}
}

备注

NAACL HLT 2018, 14 pages, 6 figures, data available at http://www.cs.cornell.edu/~jhessel/concreteness/concreteness.html