中文

HAL:通过缓解视觉语义枢纽改进文本-图像匹配

机器学习 2019-11-25 v1 计算与语言 计算机视觉与模式识别

摘要

枢纽问题广泛存在于高维嵌入空间中,是跨模态匹配任务误差的根本来源。在这项工作中,我们研究了视觉语义嵌入(VSE)中枢纽的出现,并应用于文本-图像匹配。我们分析了训练VSE两种广泛采用的优化目标的优缺点,并提出了一种新颖的枢纽感知损失函数(HAL),解决了先前方法的缺陷。与(Faghri et al.2018)简单地取小批量内最困难样本不同,HAL考虑所有样本,使用局部和全局统计来放大“枢纽”的权重。我们以不同的模型架构和数据集配置实验了我们的方法。该方法展现出极好的鲁棒性,并在所有设置下的文本-图像匹配任务上带来一致改进。具体而言,在(Faghri et al. 2018)和(Lee at al. 2018)相同的模型架构下,仅切换学习目标,我们报告在MS-COCO上最大R@1提升7.4%,在Flickr30k上提升8.3%。

关键词

引用

@article{arxiv.1911.10097,
  title  = {HAL: Improved Text-Image Matching by Mitigating Visual Semantic Hubs},
  author = {Fangyu Liu and Rongtian Ye and Xun Wang and Shuaipeng Li},
  journal= {arXiv preprint arXiv:1911.10097},
  year   = {2019}
}

备注

AAAI-20 (to appear)