从 NFoV 图像生成全景图
计算机视觉与模式识别
2025-03-25 v1
摘要
从窄视野 (NFoV) 图像生成 360 度全景图是虚拟现实 (VR) 应用中一个有前景的计算机视觉任务。现有方法大多使用基于 InceptionNet 或 CLIP 的指标来评估生成的全景图,这些指标倾向于感知图像质量且 \textbf{不适合评估失真}。在本工作中,我们首先提出一种特定于失真的 CLIP,称为 Distort-CLIP 来准确评估全景图失真并发现 \textbf{“视觉欺骗”} 现象在先前工作中 (\ie, 倾向于通过牺牲失真准确性来提高视觉结果)。这种现象是由于先前方法采用单一网络同时学习全景图失真和内容填充,导致模型优先优化后者。为解决这一问题,我们提出了 \textbf{PanoDecouple},一种解耦的扩散模型框架,将全景图生成解耦为失真引导和内容填充,旨在生成同时具有准确失真和视觉吸引力的全景图。具体而言,我们设计了一个通过施加全景图特定失真先验和修改后的条件注册机制来实现失真引导的 DistortNet;以及通过施加透视图像信息实现内容填充的 ContentNet。此外,引入以 Distort-CLIP 为约束的失真校正损失函数。广泛的实验验证了 PanoDecouple 在失真和视觉指标上均优于现有方法。
引用
@article{arxiv.2503.18420,
title = {Panorama Generation From NFoV Image Done Right},
author = {Dian Zheng and Cheng Zhang and Xiao-Ming Wu and Cao Li and Chengfei Lv and Jian-Fang Hu and Wei-Shi Zheng},
journal= {arXiv preprint arXiv:2503.18420},
year = {2025}
}
备注
CVPR2025. Project page:https://isee-laboratory.github.io/PanoDecouple/ Code:https://github.com/iSEE-Laboratory/PanoDecouple/