中文

利用多模态大语言模型实现视觉文化遗产藏品的可解释搜索与发现

计算机视觉与模式识别 2024-11-08 v1

摘要

许多文化机构已将大型数字化视觉藏品在线发布,通常附带可重复使用的许可。在缺乏细粒度元数据的情况下,为这些藏品创建探索和搜索界面是困难的。在本文中,我们介绍了一种利用最先进的多模态大语言模型(LLMs)来实现视觉藏品开放式、可解释搜索与发现界面的方法。我们展示了我们的方法如何创建新型聚类与推荐系统,从而避免直接基于视觉嵌入的方法的常见陷阱。特别值得关注的是,无需预先选择感兴趣的特征,即可为每条推荐提供具体的文本解释。这些特性共同可以创建一个更加开放灵活的数字界面,同时也更适合应对隐私和伦理问题。通过使用纪录片照片藏品的案例研究,我们提供了多个指标来展示我们方法的有效性和可能性。

关键词

引用

@article{arxiv.2411.04663,
  title  = {Explainable Search and Discovery of Visual Cultural Heritage Collections with Multimodal Large Language Models},
  author = {Taylor Arnold and Lauren Tilton},
  journal= {arXiv preprint arXiv:2411.04663},
  year   = {2024}
}

备注

16 pages, CHR 2024: Computational Humanities Research Conference, December 4 - 6, 2024, Aarhus University, Denmark