基于视觉-语言预训练模型的Iconclass多模态检索
信息检索
2023-06-30 v1 人工智能
数字图书馆
摘要
术语资源,如受控词表、叙词表和分类系统,在文化遗产数字化中起着关键作用。然而,允许查询和探索这些词汇资源的信息检索(IR)系统往往缺乏对用户搜索背后语义的恰当表示,而这些语义可通过多种表达模态(如图像、关键词或文本描述)传达。本文介绍了一个针对最广泛使用的图像志分类系统Iconclass的新搜索引擎的实现。该系统的新颖之处在于使用预训练视觉-语言模型(即CLIP)通过视觉或文本查询来检索和探索Iconclass概念。
引用
@article{arxiv.2306.16529,
title = {Multimodal Search on Iconclass using Vision-Language Pre-Trained Models},
author = {Cristian Santini and Etienne Posthumus and Mary Ann Tan and Oleksandra Bruns and Tabea Tietz and Harald Sack},
journal= {arXiv preprint arXiv:2306.16529},
year = {2023}
}