中文

迈向指代表达生成与理解的统一

计算机视觉与模式识别 2022-10-25 v1 计算与语言

摘要

指代表达生成(REG)与理解(REC)是两个高度相关的任务。同时建模 REG 与 REC 以利用二者间的关系,是改进两者的一个有前景的途径。然而,输入各异的问题,以及在单一模型中建立它们之间联系的问题,给联合模型的设计与训练带来了挑战。为解决这些问题,我们提出了一种用于 REG 和 REC 的统一模型,名为 UniRef。它通过精心设计的图像-区域-文本融合层(IRTF)统一这两个任务,该层借助图像交叉注意力和区域交叉注意力融合图像、区域与文本。此外,IRTF 可为 REC 任务生成伪输入区域,从而实现跨 REC 与 REG 共享同一表示空间的统一方式。我们进一步提出视觉条件掩码语言建模(VMLM)和文本条件区域预测(TRP),在多粒度语料库上预训练 UniRef 模型。VMLM 和 TRP 分别直接与 REG 和 REC 相关,但可相互助益。我们在三个基准数据集 RefCOCO、RefCOCO+ 和 RefCOCOg 上进行了大量实验。实验结果表明,我们的模型在 REG 和 REC 上均优于先前的最先进方法。

关键词

引用

@article{arxiv.2210.13076,
  title  = {Towards Unifying Reference Expression Generation and Comprehension},
  author = {Duo Zheng and Tao Kong and Ya Jing and Jiaan Wang and Xiaojie Wang},
  journal= {arXiv preprint arXiv:2210.13076},
  year   = {2022}
}

备注

Accepted to EMNLP 2022 (main conference)