中文

MuMIC——基于 tempered sigmoid 的多标签图像分类多模态嵌入框架

计算机视觉与模式识别 2022-11-11 v1 机器学习

摘要

多标签图像分类是多个领域的基础课题。多模态学习方法近期在图像表示和单标签图像分类中取得了优异结果。例如,对比语言-图像预训练(CLIP)展现出令人印象深刻的图文表示学习能力,并对自然分布偏移具有鲁棒性。这一成功启发我们利用多模态学习处理多标签分类任务,并从对比学习的预训练模型中获益。我们提出了多模态多标签图像分类(MuMIC)框架,其利用基于难度感知的 tempered sigmoid 的二元交叉熵损失函数,从而实现对多标签目标的优化以及基于CLIP的迁移学习。MuMIC能够提供高分类性能、处理真实世界噪声数据、支持零样本预测,并生成领域特定的图像嵌入。本研究中总共定义了120个图像类别,并在约60K张Booking.com图像上收集了超过140K个正标注。最终的MuMIC模型部署于Booking.com内容智能平台,其在全部120个类别上以85.6%的GAP@10和83.8%的GAP优于其他最先进模型,并在32个多数类别上取得90.1%的宏平均mAP分数。我们总结了经消融研究广泛测试的建模选择。据我们所知,我们首次将对比学习的多模态预训练应用于真实世界多标签图像分类问题,且该创新可迁移至其他领域。

关键词

引用

@article{arxiv.2211.05232,
  title  = {MuMIC -- Multimodal Embedding for Multi-label Image Classification with Tempered Sigmoid},
  author = {Fengjun Wang and Sarai Mizrachi and Moran Beladev and Guy Nadav and Gil Amsalem and Karen Lastmann Assaraf and Hadas Harush Boker},
  journal= {arXiv preprint arXiv:2211.05232},
  year   = {2022}
}