基于扩散 Transformer 的几何图像编辑 —— 通过效果敏感的上下文感知 inpainting
机器学习
2026-02-10 v1 分布式、并行与集群计算
摘要
近期进展显著改善了扩散模型在图像编辑方面的表现。然而,在处理几何变换(如平移、旋转和缩放)方面,尤其是在复杂场景中,仍面临挑战。现有方法存在两个主要局限:(1) 难以实现对物体平移、旋转和缩放的精准几何编辑;(2) 对复杂光照和阴影效果建模不足,导致结果不够真实。为此,我们提出了 GeoEdit 框架,利用扩散 Transformer 模块实现上下文感知生成,集成几何变换以实现精准的对象编辑。此外,我们引入了效果敏感注意力机制,以增强对复杂光照和阴影效果的建模,以提高真实性。为进一步支持训练,我们构建了 RS-Objects 数据集,包含超过 12 万对高质量图像对,使模型能够在生成真实光照和阴影的同时学习精准的几何编辑。广泛的实验表明,GeoEdit 在视觉质量、几何精度和真实性方面均一致优于最先进的方法。
关键词
引用
@article{arxiv.2602.08387,
title = {Modalities, a PyTorch-native Framework For Large-scale LLM Training and Research},
author = {Max Lübbering and Timm Ruland and Richard Rutmann and Felix Stollenwerk and David Fitzek and Michael Fromm and Alexander Weber and Rafet Sifa and Nicolas Flores-Herr and Joachim Köhler and Mehdi Ali},
journal= {arXiv preprint arXiv:2602.08387},
year = {2026}
}