中文

Text2Relight:基于文本引导的创意人像重照明

计算机视觉与模式识别 2024-12-19 v1

摘要

我们提出了一种光照感知的图像编辑流水线,给定一张人像图像和一段文本提示,即可执行单图像重照明。我们的模型修改前景和背景的照明与颜色,以与提供的文本描述对齐。文本在创造力上的无界性使我们能够用任何感官特征(包括温度、情感、气味、时间等)来描述场景的照明。然而,由于缺乏提供大量文本与重照明配对的可扩展数据集,建立这种无界文本与照明之间映射的建模极具挑战性,因此,当前的文本驱动图像编辑模型无法泛化到特定的照明应用场景。我们通过引入一种新颖的数据合成流水线来克服这个问题:首先,利用大语言模型(例如 ChatGPT),在精心设计的层次结构下自动生成描述具有各种照明场景的多样化创意文本提示。文本引导的图像生成模型创建最匹配文本的照明图像。作为照明图像的条件,我们使用单张人像图像或从光照采集系统捕获的一组 OLAT (One-Light-at-a-Time) 图像,对前景和背景执行基于图像的重照明。特别是对于背景重照明,我们将照明图像表示为一组点光源,并将它们迁移到其他背景图像。生成式扩散模型通过辅助任务增强(例如人像去照明和光照定位)学习合成的大规模数据,以关联潜在文本和照明分布,从而实现文本引导的人像重照明。

关键词

引用

@article{arxiv.2412.13734,
  title  = {Text2Relight: Creative Portrait Relighting with Text Guidance},
  author = {Junuk Cha and Mengwei Ren and Krishna Kumar Singh and He Zhang and Yannick Hold-Geoffroy and Seunghyun Yoon and HyunJoon Jung and Jae Shin Yoon and Seungryul Baek},
  journal= {arXiv preprint arXiv:2412.13734},
  year   = {2024}
}