中文

利用伪图像描述进行多模态摘要

计算与语言 2024-02-27 v2

摘要

视觉语言预训练(VLP)中的跨模态对比学习面临(部分)假负样本的挑战。本文从互信息(MI)优化的角度研究该问题。常识认为,对比学习中使用的 InfoNCE 损失会最大化锚点与其正样本之间 MI 的下界,而我们从理论上证明,当噪声普遍存在的负样本同样重要。在更通用的优化下界形式指导下,我们提出了一种由逐步精炼的跨模态相似度调节的对比学习策略,以更准确地优化图像/文本锚点与其负文本/图像之间的 MI,而非不恰当地最小化它。我们的方法在四个下游跨模态任务上表现具有竞争力,并在理论指导下系统性地平衡了(部分)假负样本的有益与有害影响。

关键词

引用

@article{arxiv.2305.05496,
  title  = {Exploiting Pseudo Image Captions for Multimodal Summarization},
  author = {Chaoya Jiang and Rui Xie and Wei Ye and Jinan Sun and Shikun Zhang},
  journal= {arXiv preprint arXiv:2305.05496},
  year   = {2024}
}

备注

Accepted at ACL2023 Findings