SE360:基于层次数据构建的 360° 全景语义编辑
计算机视觉与模式识别
2025-12-24 v1
摘要
虽然指令驱动的图像编辑正在涌现,但将其扩展到 360° 全景图面临额外挑战。现有方法常在等距矩形投影 (ERP) 和透视视图中产生不合理的结果。为解决这些限制,我们提出 SE360,一个用于 360° 全景中多条件引导对象编辑的新框架。其核心是一个无需人工干预的粗到细自主数据生成管道。该管道利用视觉语言模型 (VLM) 和自适应投影调整进行层次分析,确保对象及其物理环境的整体分割。生成的数据对既在语义上有意义又在几何上一致,即使来源于未标记的全景图也如此。此外,我们引入一种成本有效的两阶段数据细化策略,以提高数据逼真度并缓解模型对擦除伪影的过拟合。基于构建的数据集,我们训练了一个基于 Transformer 的扩散模型,允许通过文本、掩码或参考图像在 360° 全景中进行灵活的对象编辑。我们的实验表明,该方法在视觉质量和语义准确性方面均优于现有方法。
引用
@article{arxiv.2512.19943,
title = {SE360: Semantic Edit in 360$^\circ$ Panoramas via Hierarchical Data Construction},
author = {Haoyi Zhong and Fang-Lue Zhang and Andrew Chalmers and Taehyun Rhee},
journal= {arXiv preprint arXiv:2512.19943},
year = {2025}
}