EditCaption:基于人类精炼SFT和HAE-DPO的图像编辑指令合成
计算机视觉与模式识别
2026-05-26 v2 人工智能
摘要
高质量的源图像-目标图像配对伴随精确的编辑指令对于引导式图像编辑至关重要,但规模化构建此类训练三元组仍成本高昂。近期方法常依赖视觉语言模型自动合成编辑指令,但我们发现强大的VLM仍难以描述图像对之间的视觉变换。具体而言,它们表现出三种反复出现的错误模式:姿态不一致、视点模糊以及缺失细粒度属性。在对400组图像进行的人类评估中,多个开源VLM基线的关键错误率超过47%,导致许多合成指令不适用于下游训练。为此,我们提出EditCaption——一种用于图像编辑指令合成的两阶段后训练管线。首先,通过GLM-based自动描述、EditScore过滤和人类精炼构建10万条监督微调数据集。其次,收集1万组人工标注的偏好对,其中被拒绝的指令被标记为其主要错误类型和严重程度。基于此数据集,我们提出硬度自适应错误感知DPO(HAE-DPO),即一种引入基于人工标注严重程度、错误模式类型和参考模型硬度的自适应边际的任务适配DPO目标。跨越三个基准的实验表明,搭配SFT+HAE-DPO的235B模型在开源和封闭模型中实现最先进性能,在Eval-400上得分4.720,在HQ-Edit上得分4.672,在ByteMorph-Bench上得分4.651——在所有三个基准上超越Gemini-3-Pro。人类评估确认,关键错误率从47.75%下降至17.50%,正确率从41.75%提升至70.25%,超越Gemini-3-Pro(66.00%)。
引用
@article{arxiv.2604.08213,
title = {EditCaption: Human-Refined SFT and HAE-DPO for Image Editing Instruction Synthesis},
author = {Xiangyuan Wang and Honghao Cai and Yunhao Bai and Chao Hui and Tianze Zhou and Haohua Chen and Hao Shi and Yuling Wu and Yao Hu and Xu Tang and Yibo Chen and Wei Zhu},
journal= {arXiv preprint arXiv:2604.08213},
year = {2026}
}