InstructPix2NeRF:基于单张图像的人指令式 3D 肖像编辑
计算机视觉与模式识别
2024-02-05 v2
摘要
随着神经辐射场(NeRF)在 3D 感知肖像编辑中的成功,已有多种工作在质量和 3D 一致性方面取得了令人鼓舞的结果。然而,这些方法在处理自然语言作为编辑指令时严重依赖逐提示优化。由于缺乏带标注的人脸 3D 数据集和有效架构,以端到端方式面向开放世界肖像的人指令式 3D 感知编辑领域仍待探索。为解决这个问题,我们提出了一种基于扩散的端到端框架 InstructPix2NeRF,它支持利用人类指令从单张开放世界图像进行指令式 3D 感知肖像编辑。其核心是一个条件隐空间 3D 扩散过程,通过三元组数据学习配对图像差异与指令之间的相关性,从而将 2D 编辑提升到 3D 空间。借助我们提出的词元位置随机化策略,我们甚至可以在一次前向传播中实现多语义编辑,并良好保持肖像身份。此外,我们进一步提出了身份一致性模块,将提取的身份信号直接调制到我们的扩散过程中,从而提升多视角 3D 身份一致性。大量实验验证了方法的有效性,并从定量和定性上展示了相对于强基线的优越性。源代码与预训练模型见项目页:\url{https://mybabyyh.github.io/InstructPix2NeRF}。
引用
@article{arxiv.2311.02826,
title = {InstructPix2NeRF: Instructed 3D Portrait Editing from a Single Image},
author = {Jianhui Li and Shilong Liu and Zidong Liu and Yikai Wang and Kaiwen Zheng and Jinghui Xu and Jianmin Li and Jun Zhu},
journal= {arXiv preprint arXiv:2311.02826},
year = {2024}
}
备注
https://github.com/mybabyyh/InstructPix2NeRF