中文

TOSS:基于单张图像的高质量文本引导新视角合成

计算机视觉与模式识别 2023-10-17 v1

摘要

在本文中,我们提出 TOSS,将文本引入仅从单张 RGB 图像进行新视角合成(NVS)的任务。虽然 Zero-1-to-3 已展现出令人印象深刻的零样本开放集 NVS 能力,但它将 NVS 视为纯图像到图像翻译问题。该方法受限于单视角 NVS 极具挑战性的欠约束本质:过程缺乏显式用户控制手段,且常导致不合理的 NVS 生成。为解决此局限,TOSS 使用文本作为高层语义信息来约束 NVS 解空间。TOSS 微调在大规模文本-图像对上预训练的文本到图像 Stable Diffusion,并引入专门定制用于图像和相机位姿条件化的模块,以及针对位姿正确性和细节保持的专用训练。我们进行了综合实验,结果表明所提 TOSS 以更合理、可控且多视角一致的 NVS 结果优于 Zero-1-to-3。我们通过综合消融实验进一步支持这些结果,凸显了所引入语义引导和架构设计的有效性与潜力。

关键词

引用

@article{arxiv.2310.10644,
  title  = {TOSS:High-quality Text-guided Novel View Synthesis from a Single Image},
  author = {Yukai Shi and Jianan Wang and He Cao and Boshi Tang and Xianbiao Qi and Tianyu Yang and Yukun Huang and Shilong Liu and Lei Zhang and Heung-Yeung Shum},
  journal= {arXiv preprint arXiv:2310.10644},
  year   = {2023}
}