检索引导的跨视图图像合成
计算机视觉与模式识别
2025-01-28 v2 机器学习
摘要
信息�索技術在通過強大的特徵表示識別跨多樣領域的語義相似性方面展現了卓越的能力。然而,它們在引導合成任務,特別是跨視圖图像合成方面的潛力仍未得到充分探索。跨視圖图像合成在建立兩個大不相同視點之間的可靠對應關係方面存在顯著挑戰。為此,我們提出一種新型檸檢索引導框架,重新想像檸索技術如何促進有效的跨視圖图像合成。不同於依賴語義分割圖或預處理模組的現有方法,檸檢索引導框架捕獲不同視點之間的語義相似性,通過對比學習訓練以建立平滑的嵌入空間。此外,檸檷新的融合機制利用這些嵌入引導图像合成,同時學習和編碼視點不變和視點特有的特徵。為進一步推動此領域,我們引入 VIGOR-GEN,一個新型聚焦城市的數據集,包含真實場景中複雜視點變化。廣泛的實驗結果顯示,檸�索引導的方法在 CVUSA、CVACT 和 VIGOR-GEN 數據集上遠超於現有方法,特別是在檸索準確度 (R@1) 和合成質量 (FID) 上。檸檷的工作橋接了信息檸索和合成任務,提供了檸索技術如何解決複雜跨域合成挑戰的洞見。
引用
@article{arxiv.2411.19510,
title = {Retrieval-guided Cross-view Image Synthesis},
author = {Hongji Yang and Yiru Li and Yingying Zhu},
journal= {arXiv preprint arXiv:2411.19510},
year = {2025}
}