NLIP:抗噪声语言-图像预训练
计算机视觉与模式识别
2023-01-05 v2
摘要
大规模跨模态预训练范式近期在一系列下游任务(如零样本分类、检索与图像描述)上取得了普遍成功。然而,其成功高度依赖于网络爬取数据的规模与质量,这类数据天然包含不完整与噪声信息(如错误或无关内容)。现有工作要么设计人工规则清洗数据,要么生成伪标签作为降低噪声影响的辅助信号,未能同时显式应对错误与不完整这两类挑战。本文为仅通过挖掘现有数据自动缓解噪声影响,提出一种原则性的抗噪声语言-图像预训练框架(NLIP),通过噪声协调与噪声补全两种机制稳定预训练。首先,在噪声协调机制中,NLIP 依据跨模态 transformer 的记忆效应估计每对数据的噪声概率,进而采用噪声自适应正则化以协调不同程度的跨模态对齐。其次,在噪声补全机制中,为丰富文本中缺失的物体信息,NLIP 注入一个概念条件跨模态解码器,获得语义一致的合成描述以补全噪声文本,该解码器利用对应图像检索得到的视觉概念(即物体名称)引导描述生成。通过协同优化噪声协调与噪声补全机制,我们的 NLIP 能更高效缓解图文预训练中的常见噪声影响。大量实验表明,仅使用 26M 数据,我们的 NLIP 在 12 个零样本分类数据集、MSCOCO 图像描述及零样本图文检索任务上,相较现有预训练模型(如 CLIP、FILIP 与 BLIP)取得了显著性能提升。
引用
@article{arxiv.2212.07086,
title = {NLIP: Noise-robust Language-Image Pre-training},
author = {Runhui Huang and Yanxin Long and Jianhua Han and Hang Xu and Xiwen Liang and Chunjing Xu and Xiaodan Liang},
journal= {arXiv preprint arXiv:2212.07086},
year = {2023}
}
备注
AAAI 2023