中文

基于视觉-语言预训练模型的Iconclass多模态检索

信息检索 2023-06-30 v1 人工智能 数字图书馆

摘要

术语资源,如受控词表、叙词表和分类系统,在文化遗产数字化中起着关键作用。然而,允许查询和探索这些词汇资源的信息检索(IR)系统往往缺乏对用户搜索背后语义的恰当表示,而这些语义可通过多种表达模态(如图像、关键词或文本描述)传达。本文介绍了一个针对最广泛使用的图像志分类系统Iconclass的新搜索引擎的实现。该系统的新颖之处在于使用预训练视觉-语言模型(即CLIP)通过视觉或文本查询来检索和探索Iconclass概念。

关键词

引用

@article{arxiv.2306.16529,
  title  = {Multimodal Search on Iconclass using Vision-Language Pre-Trained Models},
  author = {Cristian Santini and Etienne Posthumus and Mary Ann Tan and Oleksandra Bruns and Tabea Tietz and Harald Sack},
  journal= {arXiv preprint arXiv:2306.16529},
  year   = {2023}
}