中文

多模态合成图像的物理学约束基准指标

计算机视觉与模式识别 2026-05-11 v3 人工智能

摘要

当前最先进的度量标准(如BLEU、CIDEr、VQA得分、SigLIP-2和CLIPScore)往往无法捕捉语义或结构准确性,尤其在特定领域或情境依赖的场景中。为此,本文提出了物理约束多模态数据评估(PCMDE)指标,通过结合大语言模型的推理能力、基于知识的映射和视觉语言模型来克服这些限制。该架构包含三个主要阶段:(1)通过目标检测和视觉语言模型提取空间和语义信息的特征;(2)置信加权组件融合以实现自适应组件级验证;(3)使用大语言模型进行物理导向推理,以执行结构和关系约束(如对齐、位置、一致性)的强制。

关键词

引用

@article{arxiv.2511.15204,
  title  = {Physics-Based Benchmarking Metrics for Multimodal Synthetic Images},
  author = {Kishor Datta Gupta and Marufa Kamal and Md. Mahfuzur Rahman and Fahad Rahman and Mohd Ariful Haque and Sunzida Siddique},
  journal= {arXiv preprint arXiv:2511.15204},
  year   = {2026}
}