中文

GroupEditing:一次性编辑多个图像

计算机视觉与模式识别 2026-03-27 v3

摘要

本文聚焦于在一组相关图像上执行一致且统一的修改。这一任务颇具挑战性,因为这些图像可能在姿态、视角和空间布局方面存在显著差异。实现连贯的编辑需要建立可靠的跨图像对应关系,以便准确地将修改应用到语义对齐的区域。为此,我们提出 GroupEditing,一种在图像组内构建显式与隐式关系的新框架。在显式层面,我们利用 VGGT 提取几何对应关系,该方法基于视觉特征提供空间对齐。在隐式层面,我们将图像组重新构述为伪视频,利用预训练视频模型学习的时序一致性先验来捕获潜在关系。为有效融合这两种对应关系,我们通过一种新颖的融合机制将 VGGT 提取的显式几何线索注入视频模型。为支持大规模训练,我们构建了 GroupEditData,一个包含大量图像组高质量掩码和详细说明文字的数据集。此外,为确保编辑过程中身份保持一致,我们引入了增强型 RoPE 模块,提高了模型在保持多个图像间一致外观方面的能力。最后,我们提出了 GroupEditBench,一个专门用于评估图像组级编辑效果的基准测试。广泛的实验表明,GroupEditing 在视觉质量、跨视图一致性和语义对齐方面显著优于现有方法。

关键词

引用

@article{arxiv.2603.22883,
  title  = {Group Editing: Edit Multiple Images in One Go},
  author = {Yue Ma and Xinyu Wang and Qianli Ma and Qinghe Wang and Mingzhe Zheng and Xiangpeng Yang and Hao Li and Chongbo Zhao and Jixuan Ying and Harry Yang and Hongyu Liu and Qifeng Chen},
  journal= {arXiv preprint arXiv:2603.22883},
  year   = {2026}
}

备注

Accepted by CVPR 2026, Project page: https://group-editing.github.io/, Github: https://github.com/mayuelala/GroupEditing