中文

RemEdit:基于黎曼几何的高效扩散编辑

计算机视觉与模式识别 2026-01-27 v1 多媒体

摘要

可控图像生成是现代生成式 AI 成功的基础,然而它在语义保真度与推理速度之间面临关键权衡。基于扩散的 RemEdit 框架通过两项协同创新来解决这一权衡。首先,为了编辑保真度,我们将潜空间作为黎曼流形进行导航。一个基于 mamba 的模块高效学习该流形的结构,从而能够直接且准确地计算测地线路径,实现平滑的语义编辑。这种控制进一步通过双 SLERP 混合技术和来自视觉语言模型(VLM)的目标感知提示词增强过程加以精炼。其次,为了进一步加速,我们引入了一种新颖的任务特定注意力剪枝机制。一个轻量级剪枝头学习保留对编辑至关重要的 token,从而实现有效优化,避免了内容无关方法中常见的语义退化。RemEdit 超越了先前最先进的编辑框架,同时在 50% 剪枝率下保持实时性能。因此,RemEdit 为实用且强大的图像编辑建立了新的基准。源代码:https://www.github.com/eashanadhikarla/RemEdit。

关键词

引用

@article{arxiv.2601.17927,
  title  = {RemEdit: Efficient Diffusion Editing with Riemannian Geometry},
  author = {Eashan Adhikarla and Brian D. Davison},
  journal= {arXiv preprint arXiv:2601.17927},
  year   = {2026}
}