余弦遇见Softmax:一个难以击败的视觉定位基线
计算机视觉与模式识别
2020-09-15 v1 计算与语言
摘要
本文提出了一个用于自动驾驶视觉定位的简单基线,其在保持最小设计选择的同时优于当前最先进(SOTA)方法。我们的框架在多个图像ROI特征与文本嵌入(表示给定句子/短语)之间的余弦距离上最小化交叉熵损失。我们使用预训练网络获取初始嵌入,并在文本嵌入之上学习一个变换层。我们在Talk2Car数据集上进行实验,取得了68.7%的AP50准确率,相较先前最先进水平提升了8.6%。我们的研究表明,通过展示更简单替代方案的潜力,应重新考虑那些采用复杂注意力机制、多阶段推理或复杂度量学习损失函数的方法。
引用
@article{arxiv.2009.06066,
title = {Cosine meets Softmax: A tough-to-beat baseline for visual grounding},
author = {Nivedita Rufus and Unni Krishnan R Nair and K. Madhava Krishna and Vineet Gandhi},
journal= {arXiv preprint arXiv:2009.06066},
year = {2020}
}