VectorSynth:基于结构语义的精细卫星图像合成
计算机视觉与模式识别
2025-11-12 v1
摘要
我们介绍 VectorSynth,一个基于扩散模型的框架,用于受多边形地理注释(带有语义属性)条件的像素级卫星图像合成。不同于先前基于文本或布局条件的模型,VectorSynth 学习稠密的跨模态对应关系,将图像与语义向量几何对齐,实现精细且在空间上有依托的编辑。一个视觉语言对齐模块从多边形语义中产生像素级嵌入;这些嵌入引导条件图像生成框架以尊重空间范围和语义线索。VectorSynth 支持交互式工作流程,混合语言提示与几何感知条件,允许快速的 what-if 模拟、空间编辑和以地图为导向的内容生成。为训练和评估,我们收集了一套卫星场景与像素注册的多边形注释数据集,涵盖具有建筑和自然特征的多样化城市场景。我们观察到 VectorSynth 在语义忠实度和结构真实性方面相较于先前方法取得了显著改进,我们展示的训练好的视觉语言模型展现出精细的空间对齐能力。代码和数据可在 https://github.com/mvrl/VectorSynth 获取。
引用
@article{arxiv.2511.07744,
title = {VectorSynth: Fine-Grained Satellite Image Synthesis with Structured Semantics},
author = {Daniel Cher and Brian Wei and Srikumar Sastry and Nathan Jacobs},
journal= {arXiv preprint arXiv:2511.07744},
year = {2025}
}