噪声视觉-文本文档中的领域特定词汇接地
计算与语言
2020-11-02 v1 计算机视觉与模式识别
摘要
图像能让我们洞察词语的上下文含义,但当前的图像-文本接地方法需要详细的标注。此类细粒度标注稀少、昂贵,且在大多数领域特定情境中不可用。相比之下,未标注的多图像、多句子文档十分丰富。能否从此类文档中学习词汇接地,尽管它们具有显著的词汇与视觉重叠?以一个房地产 listings(房源列表)的案例研究数据集为例,我们展示了区分高度相关的接地术语(如“厨房”与“卧室”)的挑战,并引入评估此文档相似度的度量。我们提出了一种简单的无监督基于聚类的方法,在数据集的标注子集上评估时,其精确率与召回率超越了目标检测与图像标注基线。所提方法对词的局部上下文含义尤其有效,例如将“granite(花岗岩)”在房地产数据集中与台面关联,在维基百科数据集中与岩石景观关联。
引用
@article{arxiv.2010.16363,
title = {Domain-Specific Lexical Grounding in Noisy Visual-Textual Documents},
author = {Gregory Yauney and Jack Hessel and David Mimno},
journal= {arXiv preprint arXiv:2010.16363},
year = {2020}
}