在语义图像解释中利用先验知识补偿监督信息的不完整性
机器学习
2019-10-02 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
语义图像解释是从图像中提取结构化语义描述的任务。这需要检测视觉关系:描述主体与客体之间语义关系的三元组(主体,关系,客体)。纯监督的视觉关系检测方法需要为所有可能的(主体,关系,客体)组合提供完整且均衡的训练集。然而,这样的训练集并不存在,且需要巨大的人力投入。这意味着需要能够预测训练集中未出现的三元组。该问题被称为零样本学习(zero-shot learning)。当前最先进的零样本学习方法利用训练集中关系之间的相似性,或外部语言知识。在本文中,我们使用逻辑张量网络(Logic Tensor Networks)进行零样本学习,这是一种新颖的统计关系学习(Statistical Relational Learning)框架,它同时利用与其他已见关系的相似性以及背景知识,这些背景知识以主体、关系和客体之间的逻辑约束形式表达。在视觉关系数据集(Visual Relationship Dataset)上的实验表明,使用逻辑约束优于现有方法。这意味着背景知识可用于缓解训练集的不完整性。
引用
@article{arxiv.1910.00462,
title = {Compensating Supervision Incompleteness with Prior Knowledge in Semantic Image Interpretation},
author = {Ivan Donadello and Luciano Serafini},
journal= {arXiv preprint arXiv:1910.00462},
year = {2019}
}