中文

通过多模态对比学习链接表示

计算机视觉与模式识别 2024-06-25 v3 计算与语言 综合经济学 经济学

摘要

许多应用需要跨数据集链接个人、公司或地点。最广泛使用的方法,特别是在社会科学中,不采用深度学习,记录链接通常使用字符串匹配技术来处理。此外,现有方法没有利用文档固有的多模态特性。在历史记录链接应用中,文档通常由光学字符识别 (OCR) 进行含噪转录。仅使用 OCR 文本进行链接可能会因噪声而失败,而仅使用图像裁剪进行链接也可能失败,因为视觉模型缺乏语言理解能力(例如,对公司名称缩写或其他不同书写方式的理解)。为了利用多模态学习,本研究开发了 CLIPPINGS (Contrastively LInking Pooled Pre-trained Embeddings)。CLIPPINGS 通过在文档图像及其对应 OCR 文本上进行对比语言-图像预训练,对齐对称的视觉和语言双编码器。随后,它通过对比学习一个度量空间,使得给定实例的池化图像-文本嵌入接近同一类别(例如,同一公司或地点)的嵌入,并远离不同类别的嵌入。通过将链接视为使用多模态嵌入的最近邻检索问题来链接数据。在跨金融文档链接 20 世纪中期的日本公司时,CLIPPINGS 大幅优于广泛使用的字符串匹配方法。一个纯自监督模型——仅通过将公司名称的图像裁剪嵌入与其对应的 OCR 文本嵌入对齐进行训练——也优于流行的字符串匹配方法。令人惊讶的是,多模态预训练的纯视觉编码器优于单模态预训练的纯视觉编码器,这说明了即使在推理时只有一种模态可用于链接,多模态预训练的强大能力。

关键词

引用

@article{arxiv.2304.03464,
  title  = {Linking Representations with Multimodal Contrastive Learning},
  author = {Abhishek Arora and Xinmei Yang and Shao-Yu Jheng and Melissa Dell},
  journal= {arXiv preprint arXiv:2304.03464},
  year   = {2024}
}