关注那些集合!从图像中学习量化
计算与语言
2017-04-11 v1 人工智能
计算机视觉与模式识别
摘要
近来,在融合语言与视觉表征方面取得了重大进展。但迄今为止大多数任务局限于处理对象及对象之间的词汇化关系(内容词)。然而我们知道,人类(甚至学龄前儿童)能够对原始数据进行抽象以执行某些类型的高级推理,这些推理在自然语言中由功能词表达。一个恰当的例子是他们学习量词的能力,即诸如“few”、“some”和“all”之类的表达式。从形式语义学和认知语言学可知,量词是集合上的关系,作为简化,我们可以将其视为比例。例如,在“most fish are red”中,most编码了红色鱼占鱼的比例。本文中,我们研究当前语言与视觉策略在建模此类关系方面的表现。我们表明,最先进的注意力机制与量词的传统语言形式化相结合,在该任务上取得了最佳性能。此外,我们提供了关于“要点(gist)”表征在量化中作用的见解。解决该任务的一种“逻辑”策略是首先获得两个相关集合的计数估计,然后比较它们的基数。然而我们认为,精确识别集合的构成不仅超出了当前最先进模型的能力,而且可能对通过优化系统的近似计数估计器来最有效率地执行的任务有害。
引用
@article{arxiv.1704.02923,
title = {Pay Attention to Those Sets! Learning Quantification from Images},
author = {Ionut Sorodoc and Sandro Pezzelle and Aurélie Herbelot and Mariella Dimiccoli and Raffaella Bernardi},
journal= {arXiv preprint arXiv:1704.02923},
year = {2017}
}
备注
Submitted to Journal Paper, 28 pages, 12 figures, 5 tables