从 Charles S. Peirce 手稿中提取视觉知识:运用视觉语言模型
数字图书馆
2025-11-18 v1 人工智能
机器学习
多媒体
摘要
图表在诸多学科中发挥着关键作用,却鲜有被探讨,表明了视觉表征与学术推理之间的密切联系。然而,它们的典征形式为视觉研究、跨介质分析和基于文本的数字工作流程带来了障碍。特别是,查尔斯 S. Peirce 一贯主张将图表作为推理和解释的必不可少的工具。其手稿常常将文本内容与复杂的视觉制品相结合,为研究涉及异构材料的文档提供了具有挑战性的案例。在本初步研究中,我们探讨了视觉语言模型 (VLM) 是否能够有效帮助我们在语境中识别和解释此类混合页面。首先,我们提出了一种工作流程:(i) 分段手稿页面布局,(ii) 将每个片段重新连接到 IIIF 合规的注释,(iii) 将包含图表的片段提交给 VLM。此外,借助 Peirce 的符号学框架,我们设计了提示来提取关于图表的关键知识并生成简洁的标题。最后,我们将这些标题集成到知识图谱中,实现对复合来源中图表内容的结构化表示。
关键词
引用
@article{arxiv.2511.13378,
title = {Moving Pictures of Thought: Extracting Visual Knowledge in Charles S. Peirce's Manuscripts with Vision-Language Models},
author = {Carlo Teo Pedretti and Davide Picca and Dario Rodighiero},
journal= {arXiv preprint arXiv:2511.13378},
year = {2025}
}