中文

用于跨模态图像翻译的扩散模型中的自适应域偏移

计算机视觉与模式识别 2026-02-03 v2

摘要

跨模态图像翻译仍然脆弱且低效。标准的扩散方法通常依赖于域之间的单一全局线性转移。我们发现这种捷径迫使采样器穿越流形外的高成本区域,增加了校正负担并导致语义漂移。我们将这种共同的失败模式称为固定时间表域转移。在本文中,我们将域偏移动力学直接嵌入到生成过程中。我们的模型在每个逆向步骤预测空间变化的混合场,并将显式的、与目标一致的恢复项注入到漂移中。这种同步内指导使大尺度更新保持在流形上,并将模型的角色从全局对齐转变为局部残差校正。我们提供了具有精确解形式的连续时间公式,并推导出保持边缘一致性的实用一阶采样器。从实验上看,在医学成像、遥感和电致发光语义映射的翻译任务中,我们的框架提高了结构保真度和语义一致性,同时以更少的去噪步骤实现收敛。

关键词

引用

@article{arxiv.2601.18623,
  title  = {Adaptive Domain Shift in Diffusion Models for Cross-Modality Image Translation},
  author = {Zihao Wang and Yuzhou Chen and Shaogang Ren},
  journal= {arXiv preprint arXiv:2601.18623},
  year   = {2026}
}

备注

Paper accepted as a conference paper at ICLR 2026