中文

MULTI: 通过文本掩码解缝离析相机镜头、传感器、视角及域特征,用于新颖图像生成

计算机视觉与模式识别 2026-05-13 v1 机器学习

摘要

最新的文本到图像模型产生高质量图像,但文本歧义性在需要特定风格或对象时阻碍了精确控制。已有诸多工作致力于学习和组合多个对象和图案,但当前工作几乎全部关注图像内容,忽视了诸如相机镜头、传感器类型、成像视角以及场景域特征等成像因素。我们提出了这种新挑战,称为成像因素解缝,并展示了现有方法在该领域的局限性。因此,我们提出了一种新方法MULTI,通过文本掩码解缝实现多因素解缝。该方法包含两个阶段:第一个阶段学习通用因素,第二个阶段提取数据特定因素。这种设置使我们能够扩展现有数据集并实现新颖的因素组合,从而减少分布差距。它进一步支持对特定因素的修改以及通过ControlNets实现图像到图像生成。在我们新的DF-RICO基准测试上的评估表明,MULTI的有效性,以及因素解缝作为一个新的研究方向的重要性。

关键词

引用

@article{arxiv.2605.12134,
  title  = {MULTI: Disentangling Camera Lens, Sensor, View, and Domain for Novel Image Generation},
  author = {Sonali Godavarthy and Matthias Neuwirth-Trapp and Tim-Felix Faasch and Maarten Bieshaar and Michael Moeller and Danda Pani Paudel},
  journal= {arXiv preprint arXiv:2605.12134},
  year   = {2026}
}

备注

Accepted at ICPR 2026