HYPE-EDIT-1:衡量前沿图像编辑模型可靠性的基准测试
计算机视觉与模式识别
2026-02-03 v1 人工智能
摘要
图像编辑模型的公开演示通常是效果最好的样本;实际工作流程需要为重试和审查时间付费。我们引入了HYPE-EDIT-1,一个包含100个基于参考的营销/设计编辑任务的基准测试,采用二元通过/失败评判。对于每个任务,我们生成10个独立输出,以估计单次尝试通过率、pass@10、在重试上限下的预期尝试次数,以及结合模型价格与人工审查时间的每次成功编辑的有效成本。我们发布了50个公开任务,并维护一个包含50个任务的保留私有拆分用于服务器端评估,以及一个标准化的JSON模式和用于VLM和人工评判的工具。在评估的模型中,单次尝试通过率范围为34-83%,每次成功的有效成本范围为0.66-1.42美元。考虑到重试和人工审查的总有效成本,单张图像定价低的模型实际上更昂贵。
引用
@article{arxiv.2602.00105,
title = {HYPE-EDIT-1: Benchmark for Measuring Reliability in Frontier Image Editing Models},
author = {Wing Chan and Richard Allen},
journal= {arXiv preprint arXiv:2602.00105},
year = {2026}
}
备注
14 pages, 5 figures, for code and data, see https://github.com/sourceful-official/hype-edit-1-benchmark