无需人类:自主的高质量图像编辑三元组挖掘
计算机视觉与模式识别
2025-09-26 v2 人工智能
计算与语言
机器学习
摘要
近期的生成模型进展使得能够跟随自然语言指令进行图像编辑的助手得以实现,无需额外的用户输入。其监督式训练需要数百万的三元组(原始图像、指令、编辑后图像),但挖掘像素级精确的样本极具挑战性。每次编辑都必须仅影响指令指定的区域,保持风格一致性,遵循物理合理性,并保留视觉吸引力。缺乏可靠的自动化编辑质量指标,阻碍了大规模自动化。我们提出了一种自动化、模块化的管道,能够跨域、跨分辨率、跨指令复杂度和跨风格挖掘高保真三元组。基于公开的生成模型,无需人工干预, our system 使用经过任务微调的 Gemini 验证器直接对指令遵循度和美学程度进行评分,无需任何分割或定位模型。通过反向映射和组合引导的扩增,使挖掘到的样本集约为 2.6 倍,使得大规模高保真训练数据成为可能。通过自动化处理最繁琐的标注步骤,该方法实现了无需人工标注 effort 的新规模训练。为 democratize research in this resource-intensive area,我们发布 NHR-Edit,一个包含 72 万组高质量三元组的开放数据集,经数以百万计的引导生成和验证器通过筛选,分析了管道的阶段性存活率,为不同模型堆栈估算计算 effort 提供了框架。在最大的跨数据集评估中,它超越了所有公开备选方案。我们也发布 Bagel-NHR-Edit,一个基于 Bagel 模型微调得到的 SOTA 性能模型。
引用
@article{arxiv.2507.14119,
title = {NoHumansRequired: Autonomous High-Quality Image Editing Triplet Mining},
author = {Maksim Kuprashevich and Grigorii Alekseenko and Irina Tolstykh and Georgii Fedorov and Bulat Suleimanov and Vladimir Dokholyan and Aleksandr Gordeev},
journal= {arXiv preprint arXiv:2507.14119},
year = {2025}
}