Meta-CoT:增强图像编辑中的粒度与泛化能力
计算机视觉与模式识别
2026-04-28 v1 人工智能
机器学习
多媒体
摘要
统一的多模态理解/生成模型通过将细粒度理解纳入其思维链(CoT)过程,展现了提升的图像编辑性能。然而,一个关键问题仍有待探索:何种形式的 CoT 和训练策略能够共同增强理解粒度和泛化能力?为了解决这个问题,我们提出了 Meta-CoT,这是一种对任何单图像编辑操作执行两级分解的范式,具有两个关键特性:(1)可分解性。我们观察到任何编辑意图都可以表示为一个三元组——(任务,目标,所需理解能力)。受此启发,Meta-CoT 分解了编辑任务和目标,生成特定任务的 CoT 并遍历所有目标上的编辑操作。这种分解增强了模型对编辑操作的理解粒度,并引导其在训练期间学习三元组的每个元素,从而大幅提升编辑能力。(2)泛化能力。在第二个分解级别中,我们进一步将编辑任务分解为五个基本元任务。我们发现,在这五个元任务以及三元组的其他两个元素上进行训练,足以在各种未见过的编辑任务中实现强大的泛化。为了进一步使模型的编辑行为与其 CoT 推理对齐,我们引入了 CoT-编辑一致性奖励,鼓励在编辑期间更准确、更有效地利用 CoT 信息。实验表明,我们的方法在 21 个编辑任务中实现了 15.8% 的总体提升,并且仅在少量元任务上进行训练时,也能有效泛化到未见过的编辑任务。我们的代码、基准和模型已发布于 https://shiyi-zh0408.github.io/projectpages/Meta-CoT/
引用
@article{arxiv.2604.24625,
title = {Meta-CoT: Enhancing Granularity and Generalization in Image Editing},
author = {Shiyi Zhang and Yiji Cheng and Tiankai Hang and Zijin Yin and Runze He and Yu Xu and Wenxun Dai and Yunlong Lin and Chunyu Wang and Qinglin Lu and Yansong Tang},
journal= {arXiv preprint arXiv:2604.24625},
year = {2026}
}
备注
Accepted by CVPR2026, Project Page: https://shiyi-zh0408.github.io/projectpages/Meta-CoT/