中文

DocumentCLIP:在重排文档中关联插图与正文

计算机视觉与模式识别 2024-04-29 v3 人工智能

摘要

视觉-语言预训练模型通过理解图像与文本之间的对齐,在支撑多媒体应用方面取得了巨大成功。现有视觉-语言预训练模型主要关注理解单幅图像与单段文本的关联,往往忽略了由多句文本与多幅图像构成的文档内部层级的对齐。在本工作中,我们提出 DocumentCLIP,一种显著性感知的对比学习框架,以迫使视觉-语言预训练模型理解文档内图像与较长文本之间的交互。我们的模型有益于现实世界中的多模态文档理解,如新闻文章、杂志、产品描述,它们包含语言和视觉上更丰富的内容。据我们所知,我们是首个通过对比学习探索多模态文档内部链接的工作。此外,我们收集了一个大型维基百科数据集用于预训练,其提供了多样的主题与结构。实验表明,DocumentCLIP 不仅在监督设定下优于最先进的基线,而且在经过人工评估后在真实场景中具有最佳的零样本性能。我们的代码可在 https://github.com/FuxiaoLiu/DocumentCLIP 获取。

关键词

引用

@article{arxiv.2306.06306,
  title  = {DocumentCLIP: Linking Figures and Main Body Text in Reflowed Documents},
  author = {Fuxiao Liu and Hao Tan and Chris Tensmeyer},
  journal= {arXiv preprint arXiv:2306.06306},
  year   = {2024}
}

备注

Accepted to ICPRAI 2024