中文

从文本到图像的多模态语义迁移:基于分布语义的细粒度图像分类

计算机视觉与模式识别 2020-01-09 v1 人工智能 机器学习

摘要

近年来,艺术史与遗产信息学领域的神经网络等图像分类方法已得到广泛传播(Lang 和 Ommer 2018)。这些方法面临若干挑战,包括数字人文中相对少量数据以及高维数据的处理。此处使用卷积神经网络(CNN),其输出不像通常那样是一系列扁平文本标签,而是一系列语义承载向量。这些向量源自由领域内文本语料库生成的分布语义模型(DSM)。----- 近年来,神经网络等图像分类方法在历史图像科学与遗产信息学中的应用也得到广泛传播(Lang 和 Ommer 2018)。这些方法面临一系列挑战,包括数字人文中相对少量的数据以及同时高维的数据空间。这类方法大多将分类映射到相对扁平的空间。这种扁平路径在追求本体明确性时丢失了若干相关维度,包括类之间以及非形式化上下文中的分类学、分体与关联关系。此处使用卷积神经网络(CNN),其在训练过程中的输出不同于常规地基于一系列扁平文本标签,而是基于一系列向量。这些向量源自由领域文本语料库生成的分布语义模型(DSM)。

关键词

引用

@article{arxiv.2001.02372,
  title  = {Multimodal Semantic Transfer from Text to Image. Fine-Grained Image Classification by Distributional Semantics},
  author = {Simon Donig and Maria Christoforaki and Bernhard Bermeitinger and Siegfried Handschuh},
  journal= {arXiv preprint arXiv:2001.02372},
  year   = {2020}
}

备注

19 pages, second half in German as published in DHd2020