All You Can Embed:基于自然语言与时空Transformer的车辆检索
计算机视觉与模式识别
2021-06-21 v1
摘要
将自然语言与视觉相结合代表了人工智能领域一个独特而有趣的挑战。AI City Challenge Track 5针对基于自然语言的车辆检索,聚焦于将视觉与文本信息结合应用于智慧城市用例的问题。在本文中,我们提出All You Can Embed(AYCE),一种将单车跟踪序列与自然语言相关联的模块化解决方案。所提架构的主要构建模块为(i)BERT以提供文本描述的嵌入,(ii)卷积骨干网络与Transformer模型以嵌入视觉信息。对于检索模型的训练,提出了Triplet Margin Loss的一种变体,以学习视觉与语言嵌入之间的距离度量。代码已公开于https://github.com/cscribano/AYCE_2021。
引用
@article{arxiv.2106.10153,
title = {All You Can Embed: Natural Language based Vehicle Retrieval with Spatio-Temporal Transformers},
author = {Carmelo Scribano and Davide Sapienza and Giorgia Franchini and Micaela Verucchi and Marko Bertogna},
journal= {arXiv preprint arXiv:2106.10153},
year = {2021}
}
备注
CVPR 2021 AI CITY CHALLENGE Natural Language-Based Vehicle Retrieval