中文

LLM驱动的完整性与一致性评估:用于跨模态检索中的文化遗产数据增强

计算机视觉与模式识别 2025-11-11 v1 计算机与社会

摘要

跨模态检索对于解释文化遗产数据至关重要,但其效果常因文本描述不完整或不一致而受限,这源于历史数据丢失和专家标注成本的高昂。虽然大语言模型(LLM)通过丰富文本描述提供了可行的解决方案,但其输出常因幻觉或缺乏视觉依据细节而受限。为此,我们提出了C3 C^3 ——一个通过提高LLM生成描述的完整性和一致性来提升跨模态检索性能的数据增强框架。C3 C^3 引入完整性评估模块,利用视觉线索和语言模型输出来评估语义覆盖。此外,为缓解事实不一致性,我们构建马尔可夫决策过程,以监督链式思维推理,通过自适应查询控制引导一致性评估。在文化遗产数据集CulTi和TimeTravel上,以及通用基准MSCOCO和Flickr30K上的实验表明,C3 C^3 在微调和零样本设置下均实现了最先进的性能。

关键词

引用

@article{arxiv.2511.06268,
  title  = {LLM-Driven Completeness and Consistency Evaluation for Cultural Heritage Data Augmentation in Cross-Modal Retrieval},
  author = {Jian Zhang and Junyi Guo and Junyi Yuan and Huanda Lu and Yanlin Zhou and Fangyu Wu and Qiufeng Wang and Dongming Lu},
  journal= {arXiv preprint arXiv:2511.06268},
  year   = {2025}
}