中文

EditCast3D:基于单帧引导、视频传播与视角选择的3D编辑

计算机视觉与模式识别 2025-10-16 v1

摘要

基础模型的最新进展推动了图像编辑领域的显著进步,但其向3D编辑的扩展仍未被充分探索。一种自然的方法是用基础模型替换现有工作流程中的图像编辑模块。然而,它们巨大的计算需求以及闭源API的限制和成本,使得将这些模型插入现有的迭代编辑策略变得不切实际。为了解决这一局限性,我们提出了EditCast3D,这是一个流水线,它利用视频生成基础模型在重建之前将编辑从单个第一帧传播到整个数据集。虽然编辑传播通过视频模型实现了数据集级别的编辑,但其一致性对于需要多视图对齐的3D重建而言仍非最优。为了克服这一点,EditCast3D引入了一种视角选择策略,该策略明确识别一致且对重建友好的视角,并采用前馈重建,无需昂贵的细化。结合起来,该流水线既最大限度地减少了对昂贵图像编辑的依赖,也减轻了跨图像独立应用基础模型时出现的提示歧义。我们在常用的3D编辑数据集上评估了EditCast3D,并将其与最先进的3D编辑基线进行了比较,展示了卓越的编辑质量和高效率。这些结果确立了EditCast3D作为将基础模型集成到3D编辑流水线中的可扩展且通用的范式。代码可在https://github.com/UNITES-Lab/EditCast3D获取。

关键词

引用

@article{arxiv.2510.13652,
  title  = {EditCast3D: Single-Frame-Guided 3D Editing with Video Propagation and View Selection},
  author = {Huaizhi Qu and Ruichen Zhang and Shuqing Luo and Luchao Qi and Zhihao Zhang and Xiaoming Liu and Roni Sengupta and Tianlong Chen},
  journal= {arXiv preprint arXiv:2510.13652},
  year   = {2025}
}