LLM驱动的完整性与一致性评估:用于跨模态检索中的文化遗产数据增强
计算机视觉与模式识别
2025-11-11 v1 计算机与社会
摘要
跨模态检索对于解释文化遗产数据至关重要,但其效果常因文本描述不完整或不一致而受限,这源于历史数据丢失和专家标注成本的高昂。虽然大语言模型(LLM)通过丰富文本描述提供了可行的解决方案,但其输出常因幻觉或缺乏视觉依据细节而受限。为此,我们提出了——一个通过提高LLM生成描述的完整性和一致性来提升跨模态检索性能的数据增强框架。引入完整性评估模块,利用视觉线索和语言模型输出来评估语义覆盖。此外,为缓解事实不一致性,我们构建马尔可夫决策过程,以监督链式思维推理,通过自适应查询控制引导一致性评估。在文化遗产数据集CulTi和TimeTravel上,以及通用基准MSCOCO和Flickr30K上的实验表明,在微调和零样本设置下均实现了最先进的性能。
引用
@article{arxiv.2511.06268,
title = {LLM-Driven Completeness and Consistency Evaluation for Cultural Heritage Data Augmentation in Cross-Modal Retrieval},
author = {Jian Zhang and Junyi Guo and Junyi Yuan and Huanda Lu and Yanlin Zhou and Fangyu Wu and Qiufeng Wang and Dongming Lu},
journal= {arXiv preprint arXiv:2511.06268},
year = {2025}
}