视觉接地常识知识获取
计算机视觉与模式识别
2023-03-28 v2 人工智能
计算与语言
摘要
大规模常识知识库赋能广泛AI应用,其中常识知识自动抽取(CKE)是一项基础且具有挑战性的问题。已知从文本抽取CKE受限于文本中常识的固有稀疏性与报道偏差。另一方面,视觉感知包含关于真实世界实体的丰富常识知识,例如(人,可握持,瓶子),可作为获取接地常识知识的 promising 来源。本文提出CLEVER,将CKE形式化为远程监督多示例学习问题,模型从关于实体对的图片包中总结常识关系而无需对图片实例的任何人工标注。为解决问题,CLEVER利用视觉-语言预训练模型深入理解包中每张图像,并通过新颖对比注意力机制从包中选择信息量实例以总结常识实体关系。在留出与人工评估中的综合实验结果表明,CLEVER能以 promising 质量抽取常识知识,较基于预训练语言模型的方法在AUC上高出3.9点、在mAUC上高出6.4点。预测常识分数与人工判断强相关,Spearman系数达0.78。此外,抽取常识亦可接地至图像且具合理可解释性。数据与代码见 https://github.com/thunlp/CLEVER。
引用
@article{arxiv.2211.12054,
title = {Visually Grounded Commonsense Knowledge Acquisition},
author = {Yuan Yao and Tianyu Yu and Ao Zhang and Mengdi Li and Ruobing Xie and Cornelius Weber and Zhiyuan Liu and Hai-Tao Zheng and Stefan Wermter and Tat-Seng Chua and Maosong Sun},
journal= {arXiv preprint arXiv:2211.12054},
year = {2023}
}
备注
Accepted by AAAI 2023