中文

接地语言-图像预训练

计算机视觉与模式识别 2022-06-20 v2 人工智能 计算与语言 机器学习 多媒体

摘要

本文提出一种接地语言-图像预训练 (GLIP) 模型,用于学习对象级、语言感知且语义丰富的视觉表示。GLIP 将目标检测与短语接地统一用于预训练。这种统一带来两点益处:1) 它允许 GLIP 从检测与接地数据中学习,从而改进两项任务并引导出一个良好的接地模型;2) GLIP 可通过以自训练方式生成接地框来利用海量图像-文本对,使所学表示语义丰富。在我们的实验中,我们在 27M 接地数据上预训练 GLIP,包括 3M 人工标注和 24M 网络爬取的图像-文本对。所学表示展现出对各种对象级识别任务的强零样本与少样本可迁移性。1) 直接在 COCO 与 LVIS 上评估时(预训练期间未见过 COCO 中任何图像),GLIP 分别取得 49.8 AP 与 26.9 AP,超越许多有监督基线。2) 在 COCO 上微调后,GLIP 在 val 上取得 60.8 AP,在 test-dev 上取得 61.5 AP,超越先前 SOTA。3) 迁移至 13 个下游目标检测任务时,1-shot GLIP 可与全监督 Dynamic Head 相媲美。代码发布于 https://github.com/microsoft/GLIP。

关键词

引用

@article{arxiv.2112.03857,
  title  = {Grounded Language-Image Pre-training},
  author = {Liunian Harold Li and Pengchuan Zhang and Haotian Zhang and Jianwei Yang and Chunyuan Li and Yiwu Zhong and Lijuan Wang and Lu Yuan and Lei Zhang and Jenq-Neng Hwang and Kai-Wei Chang and Jianfeng Gao},
  journal= {arXiv preprint arXiv:2112.03857},
  year   = {2022}
}

备注

CVPR 2022; updated visualizations; fixed hyper-parameters in Appendix C.1