DreamDrone:文本到图像扩散模型作为零样本连续视角生成器
计算机视觉与模式识别
2024-09-25 v3
摘要
我们引入了 DreamDrone,一种新颖的零样本且无需训练的流程,用于从文本提示生成无界的飞行场景。与其他逐帧扭曲图像的方法不同,我们主张显式地扭曲预训练文本到图像扩散模型的中间潜码,以实现高质量的图像生成和泛化能力。为了进一步提高生成图像的保真度,我们还提出了特征对应引导的扩散过程和高通滤波策略,分别以促进几何一致性和高频细节一致性。大量实验表明,DreamDrone 显著超越了现有方法,无需在数据集上进行训练或微调,也无需提前重建三维点云,即可提供具有卓越视觉质量的高度逼真的场景生成。
引用
@article{arxiv.2312.08746,
title = {DreamDrone: Text-to-Image Diffusion Models are Zero-shot Perpetual View Generators},
author = {Hanyang Kong and Dongze Lian and Michael Bi Mi and Xinchao Wang},
journal= {arXiv preprint arXiv:2312.08746},
year = {2024}
}
备注
16 pages, 12 figures, project page: https://hyokong.github.io/dreamdrone-page/