OMG:面向基于自然语言车辆检索的多粒度观测
计算机视觉与模式识别
2022-05-10 v2
摘要
通过自然语言描述检索被跟踪车辆在城市智能建设中起着关键作用。其目标是从监控视频中的一组被跟踪车辆里,为给定文本找到最佳匹配。现有工作通常通过双流框架解决该问题,该框架由文本编码器、视觉编码器和跨模态损失函数组成。尽管已取得一定进展,它们未能充分挖掘不同粒度层级的信息。为解决此问题,我们提出了一种用于基于自然语言的车辆检索任务的新框架 OMG,其针对视觉表征、文本表征和目标函数观测多粒度(Observes Multiple Granularities)。对于视觉表征,目标特征、上下文特征与运动特征被分别编码。对于文本表征,提取一个全局嵌入、三个局部嵌入以及一个颜色-类型提示嵌入来表示不同粒度的语义特征。最后,整体框架由跨模态多粒度对比损失函数优化。实验证明了我们方法的有效性。我们的 OMG 显著优于以往所有方法,并在第六届 AI City 挑战赛 Track2 中排名第 9。代码见 https://github.com/dyhBUPT/OMG。
引用
@article{arxiv.2204.08209,
title = {OMG: Observe Multiple Granularities for Natural Language-Based Vehicle Retrieval},
author = {Yunhao Du and Binyu Zhang and Xiangning Ruan and Fei Su and Zhicheng Zhao and Hong Chen},
journal= {arXiv preprint arXiv:2204.08209},
year = {2022}
}
备注
CVPR 2022 Workshop