VSE++:利用难负样本改进视觉-语义嵌入
机器学习
2018-07-31 v4 计算与语言
计算机视觉与模式识别
摘要
我们提出了一种用于跨模态检索的视觉-语义嵌入学习新技术。受难负样本挖掘、结构化预测中的难负样本以及排序损失函数的启发,我们对用于多模态嵌入的常见损失函数引入了一个简单的改变。结合微调和增强数据的使用,在检索性能上取得了显著提升。我们在MS-COCO和Flickr30K数据集上展示了我们的方法VSE++,通过消融研究和与现有方法的比较。在MS-COCO上,我们的方法在标题检索和图像检索(R@1)方面分别比最先进方法高出8.8%和11.3%。
引用
@article{arxiv.1707.05612,
title = {VSE++: Improving Visual-Semantic Embeddings with Hard Negatives},
author = {Fartash Faghri and David J. Fleet and Jamie Ryan Kiros and Sanja Fidler},
journal= {arXiv preprint arXiv:1707.05612},
year = {2018}
}
备注
Accepted as spotlight presentation at British Machine Vision Conference (BMVC) 2018. Code: https://github.com/fartashf/vsepp