CK-Transformer:面向指代表达理解的常识知识增强Transformer
计算机视觉与模式识别
2024-12-02 v1 人工智能
计算与语言
多媒体
摘要
多模态指代表达理解(REC)任务旨在定位由自然语言表达描述的图像区域,最近在学术界引起了越来越多的关注。在本文中,我们特别关注带有常识知识的指代表达理解(KB-Ref),这是一项通常需要超越空间、视觉或语义信息进行推理的任务。我们提出了一种新颖的常识知识增强Transformer(CK-Transformer)框架,该框架有效地将常识知识整合到图像中对象的表示中,从而有助于识别表达所指的目标对象。我们在KB-Ref任务的多个基准上进行了广泛的实验。我们的结果表明,所提出的CK-Transformer达到了新的最优水平,与现有最优水平相比,准确率绝对提升了3.14%。
引用
@article{arxiv.2302.09027,
title = {CK-Transformer: Commonsense Knowledge Enhanced Transformers for Referring Expression Comprehension},
author = {Zhi Zhang and Helen Yannakoudakis and Xiantong Zhen and Ekaterina Shutova},
journal= {arXiv preprint arXiv:2302.09027},
year = {2024}
}