中文

如何解读绘画:基于多模态检索的语义艺术理解

计算机视觉与模式识别 2018-10-24 v1

摘要

自动艺术分析大多集中于将艺术品分类为不同的艺术风格。然而,理解艺术表征涉及更为复杂的过程,例如识别场景中的元素或识别作者所受的影响。我们提出 SemArt,一个用于语义艺术理解的多模态数据集。SemArt 是一组美术绘画图像的集合,其中每幅图像都关联若干属性以及一段文本艺术评论,例如艺术图录或博物馆收藏中出现的那些评论。为评估语义艺术理解,我们设想了 Text2Art 挑战,这是一个多模态检索任务,即根据艺术文本检索相关绘画,反之亦然。我们还提出了若干模型,用于将视觉与文本艺术表征编码到一个共同的语义空间中。我们的最佳方法能够在 45.5% 的测试样本中于排名前 10 的图像内找到正确图像。此外,与人工评估相比,我们的模型展现出了显著的艺术理解水平。

关键词

引用

@article{arxiv.1810.09617,
  title  = {How to Read Paintings: Semantic Art Understanding with Multi-Modal Retrieval},
  author = {Noa Garcia and George Vogiatzis},
  journal= {arXiv preprint arXiv:1810.09617},
  year   = {2018}
}