多模态语义解析在墓碑铭文解释中的应用
计算机视觉与模式识别
2025-08-12 v3 计算与语言
多媒体
摘要
墓碑是充满历史和文化丰富性的文物, 包含个人生命、社区记忆、历史叙事和艺术表达。然而, 今天许多墓碑面临严重保存挑战, 包括物理侵蚀、涂鸦、环境降解和政治变迁。本文提出一种新型多模态框架用于墓碑数字化, 旨在改进墓碑内容的解释、组织和检索。我们的方法利用视觉-语言模型(VLM)将墓碑图像翻译为结构化墓碑意义表示(TMR), 捕获图像和文本信息。为进一步丰富语义解析, 我们采用检索增强生成(RAG)集成外部依赖元素, 如地名、职业代码和本体概念。与传统OCR管道相比, 本方法将解析准确率从36.1提升至89.5。我们 additionally评估了模型在不同语言和文化铭文上的鲁棒性, 并通过图像融合模拟物理损坏情况以评估其在噪声或受损条件下的性能。我们的工作首次尝试使用大型视觉-语言模型形式化墓碑理解, 为文化遗产保存带来了意义。
引用
@article{arxiv.2507.04377,
title = {Multi-Modal Semantic Parsing for the Interpretation of Tombstone Inscriptions},
author = {Xiao Zhang and Johan Bos},
journal= {arXiv preprint arXiv:2507.04377},
year = {2025}
}
备注
ACMMM 2025