Science-T2I:解决图像合成中的科学幻象
计算机视觉与模式识别
2026-04-02 v2 人工智能
机器学习
摘要
当前的图像生成模型产生视觉上令人信服但在科学上不合逻辑的图像,暴露了视觉保真度与物理真实性之间的根本性鸿沟。本文引入 ScienceT2I,一个由专家标注的数据集,包含超过 20k 对对抗图像配对和 9k 个提示,覆盖 16 个科学领域,以及一个孤立的测试集包含 454 个具有挑战性的提示。使用此基准,我们评估了 18 个最近的图像生成模型,发现 none 在隐式科学提示下得分超过 100 分,而明确描述预期结果的提示得分约高出 35 分,表明当前模型可以在被告知要描绘的内容时渲染出正确的场景,但无法从科学线索推断出正确的视觉结果。为此,我们开发 SciScore,一个从 CLIP-H 微调的奖励模型,捕捉细粒度的科学现象,而无需依赖语言引导的推理,超过 GPT-4o 和经验丰富的人类评估者约 5 分。我们进一步提出一种两阶段对齐框架,将监督微调与掩码在线微调结合,用于将科学知识注入生成模型。将此框架应用于 FLUX.1[dev] 可在 SciScore 上实现超过 50% 的相对改进,表明通过针对性数据和对齐,图像生成中的科学推理可以得到显著提升。
引用
@article{arxiv.2504.13129,
title = {Science-T2I: Addressing Scientific Illusions in Image Synthesis},
author = {Jialuo Li and Wenhao Chai and Xingyu Fu and Haiyang Xu and Saining Xie},
journal= {arXiv preprint arXiv:2504.13129},
year = {2026}
}
备注
Accepted to CVPR 2025. Code, docs, weight, benchmark and training data are all avaliable at https://jialuo-li.github.io/Science-T2I-Web