中文

面向零样本图像检索的视觉-语义嵌入方法综述

计算机视觉与模式识别 2021-09-29 v2

摘要

视觉-语义嵌入是一个有趣的研究课题,因为它对各类任务都有用,例如视觉问答(VQA)、图文检索、图像描述生成和场景图生成。本文中,我们聚焦于以句子作为查询的零样本图像检索,并综述该领域的技术趋势。首先,我们全面概述了该技术的历史,从早期图像到文本匹配研究及其随时间的演进谈起。此外,给出了实验中常用数据集的描述,并比较了各方法的评估结果。我们还介绍了 github 上可用的实现,用于确认实验准确性及进一步改进。我们希望这篇综述能鼓励研究者进一步推进连接图像与语言的研究。

关键词

引用

@article{arxiv.2105.07391,
  title  = {Survey of Visual-Semantic Embedding Methods for Zero-Shot Image Retrieval},
  author = {Kazuya Ueki},
  journal= {arXiv preprint arXiv:2105.07391},
  year   = {2021}
}

备注

Accepted by 20th IEEE International Conference on Machine Learning and Applications (ICMLA2021)