中文

超越提示:面向超分布形状的无条件 3D 反转

计算机视觉与模式识别 2026-04-17 v1

摘要

文本驱动的生成模型反转是操控 2D 或 3D 内容的核心范式,解锁了诸如文本编辑、风格迁移或逆问题等众多应用。然而,它依赖于生成模型对自然语言提示保持敏感性的假设。我们展示,对于最先进的原生文本到 3D 生成模型,此假设常常崩溃。我们识别出一种关键失效模式:生成轨迹被引导至潜在“sink trap”区域——模型对提示修改不敏感的区域。在这些区域中,输入文本的更改无法以改变输出几何形态的方式改变内部表示。关键的是,我们观察到这并非模型几何表达力的局限;相同的生成模型拥有产生多样化形状的能力,但它们对超分布\text{文本}指导不敏感。我们通过分析生成模型的采样轨迹来研究此行为,发现可通过利用模型的无条件生成先验来表示和生成复杂几何。这导致一种更稳健的文本驱动 3D 形状编辑框架,通过解耦模型的几何表示能力与其语言敏感性来规避潜在 sink。我们的ethods 解决了当前 3D 管道的局限性,实现了对超分布 3D 形状的高保真语义操控。项目网页:https://daidedou.sorpi.fr/publication/beyondprompts

关键词

引用

@article{arxiv.2604.14914,
  title  = {Beyond Prompts: Unconditional 3D Inversion for Out-of-Distribution Shapes},
  author = {Victoria Yue Chen and Emery Pierson and Léopold Maillard and Maks Ovsjanikov},
  journal= {arXiv preprint arXiv:2604.14914},
  year   = {2026}
}