多模态合成图像的物理学约束基准指标
计算机视觉与模式识别
2026-05-11 v3 人工智能
摘要
当前最先进的度量标准(如BLEU、CIDEr、VQA得分、SigLIP-2和CLIPScore)往往无法捕捉语义或结构准确性,尤其在特定领域或情境依赖的场景中。为此,本文提出了物理约束多模态数据评估(PCMDE)指标,通过结合大语言模型的推理能力、基于知识的映射和视觉语言模型来克服这些限制。该架构包含三个主要阶段:(1)通过目标检测和视觉语言模型提取空间和语义信息的特征;(2)置信加权组件融合以实现自适应组件级验证;(3)使用大语言模型进行物理导向推理,以执行结构和关系约束(如对齐、位置、一致性)的强制。
引用
@article{arxiv.2511.15204,
title = {Physics-Based Benchmarking Metrics for Multimodal Synthetic Images},
author = {Kishor Datta Gupta and Marufa Kamal and Md. Mahfuzur Rahman and Fahad Rahman and Mohd Ariful Haque and Sunzida Siddique},
journal= {arXiv preprint arXiv:2511.15204},
year = {2026}
}