中文

RadDQN:一种基于深度 Q 学习的寻找时间高效最小辐射暴露路径的架构

人工智能 2026-02-19 v1

摘要

深度强化学习(DRL)技术的最新进展激发了其在自动化领域的多方面应用。用 DRL 管理复杂的决策问题促进了其在核工业中的应用,例如在正常运行条件和潜在事故场景中优化人员的辐射暴露。然而,缺乏有效的奖励函数和有效的探索策略阻碍了其在开发辐射感知自主无人机(UAV)以实现最大辐射防护方面的实施。在本文中,我们解决了这些引人关注的问题,并引入了一种基于深度 Q 学习的架构(RadDQN),该架构在辐射感知奖励函数上运行,以在辐射区域内提供时间高效的最小辐射暴露路径。我们提出了一组独特的探索策略,根据训练期间辐射暴露的逐状态变化来微调探索和利用的程度。此外,我们将预测路径与基于网格的确定性方法进行了基准比较。我们证明,所制定的奖励函数结合适当的探索策略,可有效处理具有截然不同的辐射场分布的多种场景。与 vanilla DQN 相比,我们的模型实现了更优的收敛率和更高的训练稳定性。

关键词

引用

@article{arxiv.2402.00468,
  title  = {RadDQN: a Deep Q Learning-based Architecture for Finding Time-efficient Minimum Radiation Exposure Pathway},
  author = {Biswajit Sadhu and Trijit Sadhu and S. Anand},
  journal= {arXiv preprint arXiv:2402.00468},
  year   = {2026}
}

备注

12 pages, 7 main figures, code link (GitHub)