汉堡中找豆子:带定位的深度语义-视觉嵌入
计算机视觉与模式识别
2018-04-09 v2 计算与语言
机器学习
摘要
已有若干工作提出学习一个双路神经网络,分别将图像和文本映射到同一个共享的欧氏空间,其中几何结构捕捉有用的语义关系。这种多模态嵌入可被训练并用于多种任务,尤其是图像描述。在本工作中,我们引入此类的一种新架构,其视觉路径利用了近期空间感知的池化机制。结合从头联合训练的文本路径,我们的语义-视觉嵌入提供了一个通用模型。在带描述图像的监督下训练后,它在跨模态检索上取得了新的 SOTA 性能。它还允许将嵌入空间中的新概念定位到任意输入图像中,在短语的视觉定位上给出了 SOTA 结果。
引用
@article{arxiv.1804.01720,
title = {Finding beans in burgers: Deep semantic-visual embedding with localization},
author = {Martin Engilberge and Louis Chevallier and Patrick Pérez and Matthieu Cord},
journal= {arXiv preprint arXiv:1804.01720},
year = {2018}
}
备注
Accepted to CVPR2018