从自由手绘草图生成几何一致的多视角场景
计算机视觉与模式识别
2026-04-17 v1
摘要
我们解决一个新问题:从单个自由手绘草图生成几何一致的多视角场景。自由手绘草图是为多视角生成器提供的最几何贫乏的输入。它们通过抽象笔画传递场景意图,同时引入空间扭曲,这些扭曲与任何一致的 3D 解释相互冲突。目前尚无方法尝试解决此问题;现有的多视角方法需要照片或文本,而草图到 3D 方法则需要多个视角或高昂的 per-scene 优化。我们通过三个相互强化的贡献来应对这三个复合挑战:(i)一个约为 9000 份草图到多视角样本的精选数据集,由自动化生成和过滤管道构建;(ii)并行摄像机感知注意力适配器(CA3),将几何归纳偏置注入视频变换器;(iii)从 Structure-from-Motion 重建中派生的稀疏对应监督损失(CSL)。我们的框架在单个去噪过程中合成所有视角,无需参考图像、迭代细化或 per-scene 优化。我们的方法显著优于最先进的两阶段基线,FID 真实感提高超过 60%,几何一致性(Corr-Acc)提高 23%,同时提供最高 3.7 倍的推理加速。
引用
@article{arxiv.2604.14302,
title = {Geometrically Consistent Multi-View Scene Generation from Freehand Sketches},
author = {Ahmed Bourouis and Savas Ozkan and Andrea Maracani and Yi-Zhe Song and Mete Ozay},
journal= {arXiv preprint arXiv:2604.14302},
year = {2026}
}