中文

用于探究预训练视觉与语言模型中实体知识的表格与图像生成

计算与语言 2023-07-27 v2 计算机视觉与模式识别 机器学习

摘要

在本文中,我们提出一个表格与图像生成任务,以验证从自然语言获取的关于实体的知识如何在视觉与语言(V&L)模型中保留。该任务由两部分组成:其一是生成包含某实体知识及其相关图像的表格,其二是从带有描述文字的实体及包含该实体相关知识的表格生成图像。在两项任务中,模型必须知晓所用实体才能恰当执行生成。我们从英文维基百科约200,000个信息框构建了维基百科表格与图像生成(WikiTIG)数据集以执行所提任务。我们使用在多项任务中取得最先进(SOTA)结果的V&L模型OFA,针对上述研究问题评估任务表现。实验结果表明,OFA在预训练过程中遗忘了一部分实体知识,以此作为补充来提升图像相关任务的性能。

关键词

引用

@article{arxiv.2306.02115,
  title  = {Table and Image Generation for Investigating Knowledge of Entities in Pre-trained Vision and Language Models},
  author = {Hidetaka Kamigaito and Katsuhiko Hayashi and Taro Watanabe},
  journal= {arXiv preprint arXiv:2306.02115},
  year   = {2023}
}

备注

Accepted at ACL 2023