中文

Tinker:扩散模型赋予三维的礼物——无需逐场景优化的稀疏输入多视图一致编辑

计算机视觉与模式识别 2025-08-21 v1

摘要

我们提出 Tinker,一个用于高保真三维编辑的通用框架,可在单样本和少样本设定下运行,无需任何逐场景微调。与先前需要大量逐场景优化来确保多视图一致性或生成数十张一致编辑输入视图的技术不同,Tinker 仅需一或两张图像即可提供稳健的多视图一致编辑。这一能力源于对预训练扩散模型的重新利用,从而释放其潜在的三维感知能力。为推进该领域研究,我们构建了首个大规模多视图编辑数据集及数据管线,涵盖多样化的场景与风格。基于此数据集,我们开发了无需逐场景训练即可生成多视图一致编辑视图的框架,该框架包含两个新颖组件:(1) 指代式多视图编辑器:实现精确的、由参考驱动的编辑,并在所有视点间保持连贯。(2) 任意视图到视频合成器:利用视频扩散的时空先验,即使在稀疏输入下也能进行高质量的场景补全和新视图生成。通过大量实验,Tinker 显著降低了可泛化三维内容创作的门槛,在编辑、新视图合成和渲染增强任务上均达到了最先进的性能。我们相信,Tinker 代表了迈向真正可扩展、零样本三维编辑的关键一步。项目网页:https://aim-uofa.github.io/Tinker

关键词

引用

@article{arxiv.2508.14811,
  title  = {Tinker: Diffusion's Gift to 3D--Multi-View Consistent Editing From Sparse Inputs without Per-Scene Optimization},
  author = {Canyu Zhao and Xiaoman Li and Tianjian Feng and Zhiyue Zhao and Hao Chen and Chunhua Shen},
  journal= {arXiv preprint arXiv:2508.14811},
  year   = {2025}
}

备注

Project webpage: https://aim-uofa.github.io/Tinker