CVPR 2023第一届基础模型挑战赛Track2的解决方案
计算机视觉与模式识别
2024-04-03 v2
摘要
在本文中,我们提出了一种跨模态交通检索的解决方案。由于交通图像的跨域问题,我们通过一个简单的策略将问题分解为行人检索和车辆检索两个子任务。在行人检索任务中,我们使用IRRA作为基础模型,并专门设计了一个属性分类来挖掘属性标签隐含的知识。更重要的是,我们使用包含关系匹配的策略,使得具有包含关系的图像-文本对在特征空间中具有相似的表示。对于车辆检索任务,我们使用BLIP作为基础模型。由于对齐车辆的颜色属性具有挑战性,我们引入了基于属性的目标检测技术,为车辆图像添加颜色块以进行颜色数据增强。这作为强大的先验信息,帮助模型进行图像-文本对齐。同时,我们将标记的属性纳入图像-文本对齐损失中,以学习细粒度对齐,并防止相似的图像和文本被错误地分开。我们的方法在最终的B-board测试中以70.9的分数排名第一。
引用
@article{arxiv.2403.17702,
title = {The Solution for the CVPR 2023 1st foundation model challenge-Track2},
author = {Haonan Xu and Yurui Huang and Sishun Pan and Zhihao Guan and Yi Xu and Yang Yang},
journal= {arXiv preprint arXiv:2403.17702},
year = {2024}
}