通过知识图谱谜题增强视觉-语言模型的常识能力
计算机视觉与模式识别
2022-11-30 v1 人工智能
机器学习
摘要
本文重点分析和改进近期流行的视觉-语言(VL)模型的常识能力。尽管取得了巨大成功,我们观察到现有的 VL 模型仍然缺乏常识知识/推理能力(例如,“柠檬是酸的”),而这正是迈向通用人工智能的关键组成部分。通过分析,我们发现一个重要原因是现有的大规模 VL 数据集不包含太多常识知识,这促使我们从数据角度提升 VL 模型的常识能力。我们提出了一种更具可扩展性的策略,即“通过知识图谱线性化进行常识能力数据增强”,而不是收集新的 VL 训练数据集。它可以被视为一种数据增强技术,能够在训练过程中将常识知识动态注入到现有的 VL 数据集中。更具体地说,我们利用常识知识图谱(例如 ConceptNet),并通过双向子图序列化在 VL 数据集中创建文本描述的变体。为了更好地评估常识能力,我们进一步提出了首个基于检索的常识诊断基准。通过对一些具有代表性的 VL 模型进行大量实验,我们证明我们的 DANCE 技术能够显著提升常识能力,同时保持在原始检索任务上的性能。代码和数据可在 https://github.com/pleaseconnectwifi/DANCE 获取。
引用
@article{arxiv.2211.16504,
title = {Improving Commonsense in Vision-Language Models via Knowledge Graph Riddles},
author = {Shuquan Ye and Yujia Xie and Dongdong Chen and Yichong Xu and Lu Yuan and Chenguang Zhu and Jing Liao},
journal= {arXiv preprint arXiv:2211.16504},
year = {2022}
}
备注
Code: https://github.com/pleaseconnectwifi/DANCE Project page: shuquanye.com/DANCE_website