中文

强化学习中的自主目标检测与终止:源项估计案例研究

人工智能 2024-12-13 v3 机器学习

摘要

强化学习已在动态环境中革新了决策过程,但在缺乏明确反馈信号的情况下,往往难以自主检测和实现目标。例如,在源项估计问题中,由于缺乏精确的环境信息,难以提供明确的反馈信号,也难以定义和评估源位置的确定方式。为解决此挑战,开发了自主目标检测与终止(AGDC)模块,通过纳入用于自主目标检测和任务完成后终止的自反馈机制,增强了各种强化学习算法的能力。我们的方法有效地通过近似智能体的信念来识别和终止未定义的目标,显著提升了在反馈有限的环境中强化学习算法的能力。为验证我们方法的有效性,我们将AGDC集成到深度Q网络、近端策略优化和深度确定性策略梯度算法中,并在源项估计问题上进行评估。实验结果表明,AGDC增强的强化学习算法在成功率、平均行驶距离和搜索时间方面,均显著优于如信息轴、信息轴、双控制(用于探索和开发)以及非统计的随机动作选择方法等传统统计方法。这突显了AGDC在复杂真实场景中有效且高效的能力。

关键词

引用

@article{arxiv.2409.09541,
  title  = {Autonomous Goal Detection and Cessation in Reinforcement Learning: A Case Study on Source Term Estimation},
  author = {Yiwei Shi and Muning Wen and Qi Zhang and Weinan Zhang and Cunjia Liu and Weiru Liu},
  journal= {arXiv preprint arXiv:2409.09541},
  year   = {2024}
}