中文

面向多模态知识发现与预训练的统一持续学习框架

计算与语言 2022-06-14 v1 计算机视觉与模式识别

摘要

多模态预训练与知识发现是多模态机器学习中的两个重要研究课题。然而,现有工作均未尝试将知识发现与知识引导的多模态预训练联系起来。本文提出将二者统一到一个持续学习框架中以实现相互促进。以图像与文本的开领域单模态数据集作为输入,我们维护一个知识图谱作为支撑这两项任务的基础。对于知识发现,使用预训练模型识别图上的跨模态链接;对于模型预训练,利用该知识图谱作为外部知识引导模型更新。这两个步骤在我们的框架中迭代执行以实现持续学习。在 MS-COCO 和 Flickr30K 上针对知识发现与预训练模型所得的实验结果验证了框架的有效性。

关键词

引用

@article{arxiv.2206.05555,
  title  = {A Unified Continuous Learning Framework for Multi-modal Knowledge Discovery and Pre-training},
  author = {Zhihao Fan and Zhongyu Wei and Jingjing Chen and Siyuan Wang and Zejun Li and Jiarong Xu and Xuanjing Huang},
  journal= {arXiv preprint arXiv:2206.05555},
  year   = {2022}
}