FALCON:通过融合图像、语言描述与概念关系实现快速视觉概念学习
计算机视觉与模式识别
2022-04-01 v1 人工智能
计算与语言
机器学习
摘要
我们提出了一种元学习框架,用于仅从一到数个样本快速学习新的视觉概念,其由多种自然出现的数据流引导:同时观看图像、阅读描述场景中物体的句子,以及解释将新概念与其他概念相关联的补充句子。所学概念支持下游应用,例如通过推理未见图像来回答问题。我们的模型,即FALCON,将颜色、形状等个体视觉概念表示为高维空间("盒嵌入空间")中的轴对齐盒子。给定输入图像及其配对句子,我们的模型首先解析句子中的指称表达,并将新概念与场景中特定物体相关联。接着,我们的模型解释补充句子以将新概念与其他已知概念相关联,例如"X具有属性Y"或"X是Y的一种"。最后,它推断出新概念的最优盒嵌入,该嵌入联合地1)最大化图像中观测实例的似然,且2)满足新概念与已知概念之间的关系。我们在合成与真实世界数据集上展示了模型的有效性。
引用
@article{arxiv.2203.16639,
title = {FALCON: Fast Visual Concept Learning by Integrating Images, Linguistic descriptions, and Conceptual Relations},
author = {Lingjie Mei and Jiayuan Mao and Ziqi Wang and Chuang Gan and Joshua B. Tenenbaum},
journal= {arXiv preprint arXiv:2203.16639},
year = {2022}
}
备注
First two authors contributed equally. Project page: http://people.csail.mit.edu/jerrymei/projects/falcon/