ZEST:基于文本相似度与视觉摘要的文本描述零样本学习
计算与语言
2020-10-08 v1
摘要
我们研究从类别的文本描述中识别视觉实体的问题。具体而言,给定带有物种自由文本描述的鸟类图像,我们学习基于物种描述对先前未见过的物种的图像进行分类。该设定在视觉领域被称为基于文本的零样本学习(zero-shot learning from text),其重点在于学习将鸟类视觉方面的知识从已见类别迁移到先前未见的类别。在此,我们建议聚焦于文本描述,并从描述中提炼最相关的信息,以有效地将视觉特征与讨论这些特征的文本部分相匹配。具体而言,(1) 我们提出利用物种之间的相似性,这种相似性反映在物种文本描述之间的相似性中。(2) 我们推导文本的视觉摘要,即聚焦于往往反映在图像中的视觉特征的可抽取摘要。我们提出了一种简单的基于注意力的模型,并增强了相似度与视觉摘要组件。我们的实证结果在基于文本的零样本学习的最大基准上持续且显著优于 SOTA(state-of-the-art,最优性能),说明了文本对于零样本图像识别的关键重要性。
引用
@article{arxiv.2010.03276,
title = {ZEST: Zero-shot Learning from Text Descriptions using Textual Similarity and Visual Summarization},
author = {Tzuf Paz-Argaman and Yuval Atzmon and Gal Chechik and Reut Tsarfaty},
journal= {arXiv preprint arXiv:2010.03276},
year = {2020}
}
备注
11 pages, Findings of EMNLP 2020