融合视觉与文本输入用于大规模地图集合检索
信息检索
2024-10-03 v1 数字图书馆
摘要
尽管地图在数字收藏中广为流行且历史重要,但当前方法在导航和探索地图收藏方面主要局限于目录记录和结构化元数据。本文探讨了使用自然语言输入("搜索带有海怪的地图")、视觉输入(即逆向图像搜索)以及多模态输入(一个示例地图 + "更多灰度")进行大规模地图集合交互式搜索的潜力。作为案例研究,我们采用可通过美国国会图书馆 API 公开获取的 562,842 张地图图像。为实现此目标,我们使用多模态对比语言-图像预训练(CLIP)机器学习模型为这些地图生成嵌入向量,并开发代码以实现这些输入策略的探索性搜索功能。我们呈现了与美国国会地理与地图部门工作人员共同创建的示例搜索结果,描述了这些搜索查询的优势、劣势及可能性。此外,我们引入了 10,504 组地图-标题对的精调数据集,以及用于在该数据集上精调 CLIP 模型的体系结构。为便于复用,我们提供所有代码于已记录的交互式 Jupyter 笔记本中,并将所有代码置于公共领域。最后,我们讨论了将这些方法跨越数字化和出生数字化收藏(由画廊、图书馆、档案馆和博物馆持有)的机会与挑战。
引用
@article{arxiv.2410.01190,
title = {Integrating Visual and Textual Inputs for Searching Large-Scale Map Collections with CLIP},
author = {Jamie Mahowald and Benjamin Charles Germain Lee},
journal= {arXiv preprint arXiv:2410.01190},
year = {2024}
}
备注
18 pages, 7 figures, accepted at the Computational Humanities Research Conference (CHR 2024)