中文

Text2Light:零样本文本驱动的 HDR 全景生成

计算机视觉与模式识别 2023-04-17 v3 图形学

摘要

高质量 HDRI(高动态范围图像),通常为 HDR 全景,是图形学中创建逼真光照与 3D 场景 360 度反射最为流行的方式之一。鉴于捕获 HDRI 的困难,一种通用且可控的生成模型备受期待,使普通用户能够直观地控制生成过程。然而,现有的最优方法仍难以为复杂场景合成高质量全景。在本工作中,我们提出一种零样本文本驱动框架 Text2Light,以在无配对训练数据的情况下生成 4K+ 分辨率的 HDRI。给定一段自由形式的文本作为场景描述,我们通过两个专门步骤合成相应的 HDRI:1)在低动态范围(LDR)与低分辨率下的文本驱动全景生成;2)超分辨率逆色调映射,在分辨率与动态范围上同时放大 LDR 全景。具体而言,为实现零样本文本驱动全景生成,我们首先构建双码本作为多样环境纹理的离散表示。随后,在预训练的 CLIP 模型驱动下,一个文本条件的全局采样器学习根据输入文本从全局码本中采样整体语义。此外,一个结构感知的局部采样器在整体语义引导下逐块合成 LDR 全景。为实现超分辨率逆色调映射,我们从 LDR 全景导出 360 度成像的连续表示,作为锚定于球面上的一组结构化潜码。该连续表示使一个通用模块能够同时上缩放分辨率与动态范围。大量实验证明了 Text2Light 在生成高质量 HDR 全景方面的优越能力。此外,我们展示了我们的工作在逼真渲染与沉浸式 VR 中的可行性。

关键词

引用

@article{arxiv.2209.09898,
  title  = {Text2Light: Zero-Shot Text-Driven HDR Panorama Generation},
  author = {Zhaoxi Chen and Guangcong Wang and Ziwei Liu},
  journal= {arXiv preprint arXiv:2209.09898},
  year   = {2023}
}

备注

SIGGRAPH Asia 2022; Project Page https://frozenburning.github.io/projects/text2light/ Codes are available at https://github.com/FrozenBurning/Text2Light