中文

基于神经网络的跨模态艺术品检索

多媒体 2023-07-27 v1

摘要

构建面向艺术品图像(尤其是绘画)的智能检索系统,对于记录文化遗产、促进公众广泛参与以及推进艺术分析与阐释至关重要。视觉-语义嵌入(Visual-Semantic Embedding, VSE)网络是用于信息检索的深度学习模型,其学习文本与视觉数据的联合表示,可实现1)跨模态检索任务,如图像到文本与文本到图像检索;以及2)关系聚焦检索,以捕捉实体关系并提供更具上下文相关性的搜索结果。尽管VSE网络在跨模态信息检索中发挥重要作用,但其在绘画数据集(如ArtUK)上的应用仍属空白。本文介绍BoonArt,一种基于VSE的跨模态搜索引擎,允许用户使用文本查询搜索图像,并在使用图像查询时获取相应文本描述及对应图像。BoonArt的性能使用ArtUK数据集评估。实验评估显示,BoonArt在图像到文本检索上达到97%的Recall@10,在文本到图像检索上达到97.4%的Recall@10。通过弥合文本与视觉模态间的鸿沟,BoonArt相较传统搜索引擎(如ArtUK网站所提供的)实现了大幅改善的搜索性能。BoonArt可用于其他艺术品数据集。

关键词

引用

@article{arxiv.2307.14244,
  title  = {Neural-based Cross-modal Search and Retrieval of Artwork},
  author = {Yan Gong and Georgina Cosma and Axel Finke},
  journal= {arXiv preprint arXiv:2307.14244},
  year   = {2023}
}