中文

VSE++:利用难负样本改进视觉-语义嵌入

机器学习 2018-07-31 v4 计算与语言 计算机视觉与模式识别

摘要

我们提出了一种用于跨模态检索的视觉-语义嵌入学习新技术。受难负样本挖掘、结构化预测中的难负样本以及排序损失函数的启发,我们对用于多模态嵌入的常见损失函数引入了一个简单的改变。结合微调和增强数据的使用,在检索性能上取得了显著提升。我们在MS-COCO和Flickr30K数据集上展示了我们的方法VSE++,通过消融研究和与现有方法的比较。在MS-COCO上,我们的方法在标题检索和图像检索(R@1)方面分别比最先进方法高出8.8%和11.3%。

关键词

引用

@article{arxiv.1707.05612,
  title  = {VSE++: Improving Visual-Semantic Embeddings with Hard Negatives},
  author = {Fartash Faghri and David J. Fleet and Jamie Ryan Kiros and Sanja Fidler},
  journal= {arXiv preprint arXiv:1707.05612},
  year   = {2018}
}

备注

Accepted as spotlight presentation at British Machine Vision Conference (BMVC) 2018. Code: https://github.com/fartashf/vsepp