中文

RL-I2IT:基于深度强化学习的图像到图像翻译

计算机视觉与模式识别 2025-12-10 v9 人工智能

摘要

大多数现有的图像到图像翻译(I2IT)方法在深度学习(DL)模型的一次运行中生成图像。然而,设计这样一种单步模型始终具有挑战性,需要大量参数且容易陷入糟糕的全局极小值和过拟合。在这项工作中,我们通过深度强化学习(DRL)将 I2IT 重新表述为逐步决策问题,并提出了一种执行基于 RL 的 I2IT(RL-I2IT)的新框架。RL-I2IT 框架的关键特征是将整体学习过程分解为具有轻量模型的小步骤,以逐步将源图像连续变换为目标图像。考虑到在常规 RL 框架中处理高维连续状态和动作空间具有挑战性,我们向标准 Actor-Critic 模型引入了带有新概念 Plan 的元策略,其维度低于原始图像,并可促进 actor 生成易于处理的高维动作。在 RL-I2IT 框架中,我们还采用任务特定的辅助学习策略来稳定训练过程并提升相应任务的性能。在多个 I2IT 任务上的实验证明了所提方法在面对高维连续动作空间问题时的有效性和鲁棒性。我们对 RL-I2IT 框架的实现可在 https://github.com/Algolzw/SPAC-Deformable-Registration 获取。

关键词

引用

@article{arxiv.2309.13672,
  title  = {RL-I2IT: Image-to-Image Translation with Deep Reinforcement Learning},
  author = {Jing Hu and Ziwei Luo and Chengming Feng and Shu Hu and Bin Zhu and Xi Wu and Xin Li and Hongtu Zhu and Siwei Lyu and Xin Wang},
  journal= {arXiv preprint arXiv:2309.13672},
  year   = {2025}
}