CSHNet:一种新型信息不对称图像翻译方法
计算机视觉与模式识别
2025-01-20 v1
摘要
尽管跨域图像翻译取得了进展,但在诸如 SAR-to-Optical 和 Sketch-to-Instance 等不对称任务中仍存在挑战,这些任务涉及将来自较不详细领域的数据转换为内容更丰富的数据。传统的基于卷积神经网络的方法在捕捉细节方面有效,但在处理全局结构方面不足,导致图像区域不期望的合并。在此基础上,我们提出了 CNN-Swin 混合网络(CSHNet),该网络包含两个关键模块:Swin Embedded CNN(SEC)和 CNN Embedded Swin(CES),形成 SEC-CES-Bottleneck(SCB)结构。SEC 利用 CNN 的细节特征提取能力,同时整合了 Swin Transformer 的结构偏置。CES 则保留了 Swin Transformer 的全局完整性,弥补了 CNN 在结构方面不足的关注点。此外,CSHNet 包括两个组件,用于增强跨域信息保留:交互式引导连接(Interactive Guided Connection, IGC),使 SEC 和 CES 之间能够进行动态信息交换;自适应边缘感知损失(Adaptive Edge Perception Loss, AEPL),在翻译过程中保持结构边界。实验结果表明,CSHNet 在场景级和实例级数据集的视觉质量和性能指标上均优于现有方法。我们的代码可在 https://github.com/XduShi/CSHNet 查阅。
引用
@article{arxiv.2501.10197,
title = {CSHNet: A Novel Information Asymmetric Image Translation Method},
author = {Xi Yang and Haoyuan Shi and Zihan Wang and Nannan Wang and Xinbo Gao},
journal= {arXiv preprint arXiv:2501.10197},
year = {2025}
}