利用多模态大语言模型实现视觉文化遗产藏品的可解释搜索与发现
计算机视觉与模式识别
2024-11-08 v1
摘要
许多文化机构已将大型数字化视觉藏品在线发布,通常附带可重复使用的许可。在缺乏细粒度元数据的情况下,为这些藏品创建探索和搜索界面是困难的。在本文中,我们介绍了一种利用最先进的多模态大语言模型(LLMs)来实现视觉藏品开放式、可解释搜索与发现界面的方法。我们展示了我们的方法如何创建新型聚类与推荐系统,从而避免直接基于视觉嵌入的方法的常见陷阱。特别值得关注的是,无需预先选择感兴趣的特征,即可为每条推荐提供具体的文本解释。这些特性共同可以创建一个更加开放灵活的数字界面,同时也更适合应对隐私和伦理问题。通过使用纪录片照片藏品的案例研究,我们提供了多个指标来展示我们方法的有效性和可能性。
引用
@article{arxiv.2411.04663,
title = {Explainable Search and Discovery of Visual Cultural Heritage Collections with Multimodal Large Language Models},
author = {Taylor Arnold and Lauren Tilton},
journal= {arXiv preprint arXiv:2411.04663},
year = {2024}
}
备注
16 pages, CHR 2024: Computational Humanities Research Conference, December 4 - 6, 2024, Aarhus University, Denmark