面向零样本图像检索的视觉-语义嵌入方法综述
计算机视觉与模式识别
2021-09-29 v2
摘要
视觉-语义嵌入是一个有趣的研究课题,因为它对各类任务都有用,例如视觉问答(VQA)、图文检索、图像描述生成和场景图生成。本文中,我们聚焦于以句子作为查询的零样本图像检索,并综述该领域的技术趋势。首先,我们全面概述了该技术的历史,从早期图像到文本匹配研究及其随时间的演进谈起。此外,给出了实验中常用数据集的描述,并比较了各方法的评估结果。我们还介绍了 github 上可用的实现,用于确认实验准确性及进一步改进。我们希望这篇综述能鼓励研究者进一步推进连接图像与语言的研究。
引用
@article{arxiv.2105.07391,
title = {Survey of Visual-Semantic Embedding Methods for Zero-Shot Image Retrieval},
author = {Kazuya Ueki},
journal= {arXiv preprint arXiv:2105.07391},
year = {2021}
}
备注
Accepted by 20th IEEE International Conference on Machine Learning and Applications (ICMLA2021)