中文

RC3:正则化对比跨语言跨模态预训练

计算与语言 2023-05-16 v1

摘要

多语言视觉-语言(V&L)预训练在学习跨不同模态与语言的通用表征方面取得了显著进展。尽管近期取得成功,在多语言环境下 V&L 预训练模型进一步提升仍面临挑战。特别是,当前 V&L 预训练方法严重依赖由以英语为中心的数据集通过机器翻译生成的严格对齐多语言图文对。然而,收集并翻译此类严格对齐数据集的成本通常难以承受。本文提出正则化对比跨语言跨模态(RC^3)预训练,进一步利用更丰富的弱对齐多语言图文对。具体而言,我们设计了一个正则化跨语言视觉-文本对比学习目标,根据文本相关性约束弱对齐视觉-文本输入的表征邻近度。此外,现有 V&L 预训练方法处理视觉输入主要采用感兴趣区域(ROI)特征或图像块嵌入。我们灵活地将两种视觉特征形式集成到模型中,用于预训练与下游多模态任务。在跨越 6 种语言的 5 个下游多模态任务上的大量实验证明了我们所提方法相较具有更强零样本能力的对比模型的有效性。

关键词

引用

@article{arxiv.2305.07927,
  title  = {RC3: Regularized Contrastive Cross-lingual Cross-modal Pre-training},
  author = {Chulun Zhou and Yunlong Liang and Fandong Meng and Jinan Xu and Jinsong Su and Jie Zhou},
  journal= {arXiv preprint arXiv:2305.07927},
  year   = {2023}
}

备注

accepted to ACL 2023 Findings