中文

DiffuSyn基准:基于扩散生成的合成基准评估视觉语言模型中的真实复杂性

计算机视觉与模式识别 2025-11-21 v3 人工智能

摘要

本研究评估了大型视觉语言模型(LVLMs)区分AI生成与人类生成图像的能力。引入了新的自动化基准构建方法。实验将常见LVLMs与人类参与者使用混合数据集(包含AI和人类创建图像)进行比较。结果表明,LVLMs在一定程度上能够区分图像类型,但表现出右偏,并显著逊于人类。为此,我们开发了基于AI的自动化基准构建流程,包括主题检索、叙事脚本生成、错误嵌入和图像生成,创建了一组文本-图像对,包含故意引入的错误。通过构建两个可行的基准进行验证。本研究突显了LVLMs在现实世界理解中的优势与不足,推进了基准构建技术,提供了可扩展且自动化的AI模型评估方法。

关键词

引用

@article{arxiv.2406.04470,
  title  = {DiffuSyn Bench: Evaluating Vision-Language Models on Real-World Complexities with Diffusion-Generated Synthetic Benchmarks},
  author = {Haokun Zhou and Yipeng Hong},
  journal= {arXiv preprint arXiv:2406.04470},
  year   = {2025}
}