DynT2I-Eval:文本到图像模型的动态评估框架
计算机视觉与模式识别
2026-05-08 v1
摘要
现有的文本到图像(T2I)基准主要依赖固定的提示集,这使得它们在公开发布并被反复重用后容易受到过拟合和基准污染的影响。在本文中,我们提出了 DynT2I-Eval,一个用于 T2I 模型的全自动动态评估框架。它从长篇描述中构建结构化的视觉语义空间,将提示分解为可控维度(例如,主体、逻辑约束、环境和构图)。这能够通过特定任务空间和难度感知采样持续生成新提示。DynT2I-Eval 在文本对齐、感知质量和美学方面评估模型性能。异构输出被统一为基于提示条件的成对比较,允许动态调度器、微批次聚合和加权贝叶斯更新在提示分布和模型注入不断变化的情况下维持稳定的在线排行榜。使用独立采样的提示流进行的实验表明,持续刷新的提示提供了稳健的评估协议,减少了特定提示集微调的影响。模拟和消融实验进一步证实,所提出的排名框架在冷启动收敛、后加入发现和长期排名保真度之间实现了良好的平衡。
引用
@article{arxiv.2605.06170,
title = {DynT2I-Eval: A Dynamic Evaluation Framework for Text-to-Image Models},
author = {Juntong Wang and Jiarui Wang and Huiyu Duan and Lewei Li and Guangtao Zhai and Xiongkuo Min},
journal= {arXiv preprint arXiv:2605.06170},
year = {2026}
}