360PanT:免训练文本驱动的 360 度全景图到全景图转换
计算机视觉与模式识别
2024-09-16 v1 人工智能
摘要
在 360 度全景图转换中保持边界连续性,对于现有的文本驱动图像到图像转换方法而言仍是一项重大挑战。这些方法常在转换后的全景图边界处产生视觉上突兀的不连续性,破坏了沉浸式体验。为解决此问题,我们提出 360PanT,一种具有边界连续性的、免训练的文本驱动 360 度全景图到全景图转换方法。我们的 360PanT 通过两个关键组件实现无缝转换:边界连续性编码和带有空间控制的无缝平铺转换。首先,边界连续性编码通过构建扩展输入图像,将输入 360 度全景图的关键边界连续性信息嵌入到含噪潜在表示中。其次,利用该嵌入的含噪潜在表示并在目标提示词的引导下,带有空间控制的无平铺转换能够生成左右两半相同的转换图像,同时遵循扩展输入的结构与语义布局。该过程确保了最终转换的 360 度全景图具有无缝的边界连续性。在真实世界和合成数据集上的实验结果均证明了 360PanT 在转换 360 度全景图方面的有效性。代码可在 \href{https://github.com/littlewhitesea/360PanT}{https://github.com/littlewhitesea/360PanT} 获取。
引用
@article{arxiv.2409.08397,
title = {360PanT: Training-Free Text-Driven 360-Degree Panorama-to-Panorama Translation},
author = {Hai Wang and Jing-Hao Xue},
journal= {arXiv preprint arXiv:2409.08397},
year = {2024}
}
备注
Accepted by WACV 2025, Project Page: \href{https://littlewhitesea.github.io/360PanT.github.io/}{https://littlewhitesea.github.io/360PanT.github.io/}