CVPR2023 NICE 图像描述挑战赛的解决方案
计算机视觉与模式识别
2024-07-08 v2 图像与视频处理
摘要
在本文中,我们给出针对零样本图像描述新前沿挑战赛(New frontiers for Zero-shot Image Captioning Challenge)的解决方案。与传统图像描述数据集不同,该挑战赛包含来自众多领域(如 COVID-19)的更大规模新型视觉概念,以及各类图像类型(照片、插图、图形)。在数据层面,我们从 Laion-5B(一个大规模 CLIP 过滤的图像-文本数据集)收集外部训练数据。在模型层面,我们使用 OFA(一个基于手工模板的大规模视觉-语言预训练模型)来执行图像描述任务。此外,我们引入对比学习以对齐图像-文本对,在预训练阶段学习新视觉概念。接着,我们提出相似度分桶策略并将该策略融入模板,以迫使模型生成更高质量、更匹配的描述。最后,通过检索增强策略,我们构建富含内容的模板,包含来自其他图像-文本对中最相关的 top-k 条描述,以引导模型生成语义丰富的描述。我们的方法在排行榜上排名第一,在验证阶段与测试阶段分别取得 105.17 与 325.72 的 Cider-Score。
引用
@article{arxiv.2310.06879,
title = {The Solution for the CVPR2023 NICE Image Captioning Challenge},
author = {Xiangyu Wu and Yi Gao and Hailiang Zhang and Yang Yang and Weili Guo and Jianfeng Lu},
journal= {arXiv preprint arXiv:2310.06879},
year = {2024}
}