LadleNet:基于语义分割引导的红外图像到可见光图像翻译的两阶段 UNet
计算机视觉与模式识别
2024-04-16 v3 机器学习
图像与视频处理
摘要
将热红外(TIR)图像翻译为可见光(VI)图像在提升模型性能与泛化能力方面起着关键作用,尤其在 TIR 与 VI 图像的配准与融合等诸多领域。然而,该领域当前研究面临翻译后图像质量不够真实以及现有模型难以适应未见场景的难题。为开发更具泛化性的图像翻译架构,我们对现有翻译架构进行了分析。通过探究现有翻译架构中中间模态的可解释性,我们发现街景图像翻译过程中的中间模态本质上执行语义分割,即在分配颜色信息之前依据背景与前景模式区分街景图像。基于这些原理,我们提出一种基于 U-net 的改进算法称为 LadleNet。该网络采用由 Handle 与 Bowl 模块组成的两阶段 U-net 级联结构。Handle 模块负责构建抽象语义空间,而 Bowl 模块解码该语义空间以获得映射的 VI 图像。由于语义分割的特性,Handle 模块具有强扩展性。因此,我们还提出 LadleNet+,其将 LadleNet 中的 Handle 模块替换为预训练的 DeepLabv3+ 网络,使模型具备更强大的语义空间构建能力。所提方法在 KAIST 数据集上训练与测试,并进行了定量与定性分析。与现有方法相比,LadleNet 与 LadleNet+ 在 SSIM 指标上分别平均提升 12.4% 与 15.2%,在 MS-SSIM 指标上分别平均提升 37.9% 与 50.6%。
引用
@article{arxiv.2308.06603,
title = {LadleNet: A Two-Stage UNet for Infrared Image to Visible Image Translation Guided by Semantic Segmentation},
author = {Tonghui Zou and Lei Chen},
journal= {arXiv preprint arXiv:2308.06603},
year = {2024}
}