中文

CMA-CLIP:用于图文分类的跨模态注意力 CLIP

计算机视觉与模式识别 2021-12-10 v2 计算与语言 机器学习

摘要

现代 Web 系统(如社交媒体和电子商务)包含以图像和文本表达的丰富内容。利用多模态信息可以提升分类与推荐等机器学习任务的性能。本文提出跨模态注意力对比语言-图像预训练(CMA-CLIP),一种统一两类跨模态注意力(序列级注意力与模态级注意力)以有效融合图像-文本对信息的新框架。序列级注意力使框架能够捕捉图像块与文本词元之间的细粒度关系,而模态级注意力则依据各模态与下游任务的相关性为其赋权。此外,通过添加任务特定的模态级注意力与多层感知机,我们所提框架能够执行基于多模态的多任务分类。我们在某大型零售网站商品属性(MRWPA)数据集及两个公开数据集 Food101 和 Fashion-Gen 上开展实验。结果表明,在多任务分类上,CMA-CLIP 于相同精度水平下在 MRWPA 数据集上的召回率平均超越预训练并微调的 CLIP 达 11.9%。它还在 Fashion-Gen 数据集上以 5.5% 的精度优势超越 SOTA 方法,并在 Food101 数据集上取得具竞争力的性能。通过详尽的消融实验,我们进一步证明了两种跨模态注意力模块的有效性,以及我们的方法对图像与文本输入中噪声的鲁棒性——后者是实践中常见的挑战。

关键词

引用

@article{arxiv.2112.03562,
  title  = {CMA-CLIP: Cross-Modality Attention CLIP for Image-Text Classification},
  author = {Huidong Liu and Shaoyuan Xu and Jinmiao Fu and Yang Liu and Ning Xie and Chien-Chih Wang and Bryan Wang and Yi Sun},
  journal= {arXiv preprint arXiv:2112.03562},
  year   = {2021}
}

备注

9 pages, 2 figures, 6 tables, 1 algorithm