中文

面向中国文化遗产文档的跨模态检索:数据集与解决方案

计算机视觉与模式识别 2025-07-22 v2

摘要

中国拥有悠久盛世的历史,涵盖丰富的文化遗产,包含多样的多模态信息,如丝绸纹样、敦煌壁画及其相关的历史叙述。跨模态检索在理解和解读中国文化遗产方面发挥着关键作用,通过桥接视觉模态与文本模态,实现准确的文本到图像和图像到文本检索。然而,尽管多模态研究日益受到关注,但缺乏专为中国文化遗产设计的数据集,限制了该领域跨模态学习模型的开发与评估。为此,我们提出一种名为CulTi的多模态数据集,包含从两系列专业文档中提取的5,726个图像-文本对,分别与古代丝绸和敦煌壁画相关。与现有通用领域数据集相比,CulTi为跨模态检索带来挑战:复杂装饰图案与专业文本描述之间的细粒度对齐困难。为此,我们提出LACLIP——一种基于微调中文CLIP的训练自由的局部对齐策略。LACLIP通过在推理过程中计算加权相似度得分,增强全局文本描述与局部视觉区域的对齐。在CulTi上的实验结果表明,LACLIP在跨模态检索中显著优于现有模型,尤其在处理中国文化遗产中的细粒度语义关联方面。

关键词

引用

@article{arxiv.2505.10921,
  title  = {Towards Cross-modal Retrieval in Chinese Cultural Heritage Documents: Dataset and Solution},
  author = {Junyi Yuan and Jian Zhang and Fangyu Wu and Dongming Lu and Huanda Lu and Qiufeng Wang},
  journal= {arXiv preprint arXiv:2505.10921},
  year   = {2025}
}