中文

提示我一个数据集:基于基础模型的历史图像数据集创建中文本-图像提示的探究

计算机视觉与模式识别 2023-09-06 v1 人工智能 数字图书馆

摘要

在本文中,我们提出了一种利用基础模型从历史文档中提取图像的流水线,并评估了文本-图像提示及其在复杂度各异的人文学科数据集上的有效性。该方法的动机一方面源于历史学家对与历史文本一同印刷的视觉元素的高度兴趣,另一方面源于人文学科内相对于其他领域相对缺乏良好标注的数据集。我们提出了一种顺序方法,依赖 GroundDINO 和 Meta 的 Segment-Anything-Model(SAM)来从历史文档中检索大量视觉数据,这些数据随后可用于下游开发任务和数据集创建,并评估了不同语言提示对所得检测结果的影响。

关键词

引用

@article{arxiv.2309.01674,
  title  = {Prompt me a Dataset: An investigation of text-image prompting for historical image dataset creation using foundation models},
  author = {Hassan El-Hajj and Matteo Valleriani},
  journal= {arXiv preprint arXiv:2309.01674},
  year   = {2023}
}

备注

12 pages, 3 figures, Accepted in ICIAP2023, AI4DH workshop