中文

面向现实世界的人类在环深度强化学习设计的系统方法:显著特征、挑战与权衡

人工智能 2025-04-25 v1 机器学习 机器人学

摘要

随着深度强化学习 (DRL) 的日益流行,人类在环 (HITL) 方法有望彻底改变我们解决决策问题的方式,并为人类-AI 合作创造新机遇。本文介绍了一种新颖的多层次分层 HITL DRL 算法,包含三种类型 of 学习:自学习、模仿学习和迁移学习。此外,我们考虑了三种形式的人类输入:奖励、动作和演示。我们进一步讨论了 HITL 在解决复杂问题方面的主要挑战、权衡与优势,以及如何系统地将人类信息集成到 AI 解决方案中。为了验证我们的技术结果,我们提出了一个现实世界的无人机问题,其中一组敌方无人机攻击受限区域。目标是为盟机无人机设计一种可扩展的 HITL DRL 算法,以在敌方无人机抵达该区域前中和它们。为此,我们首先使用一款获奖的开源 HITL 软件 Cogment 实现了我们的解决方案。随后,我们展示了几个有趣的结果,如:(a) HITL 加快训练速度并提升性能;(b) 建议作为梯度方法的指导方向,降低方差;(c) 建议的数量既不能太大也不能太小,以避免过度训练和欠训练。最后,我们说明了在解决两个现实世界复杂情景(即超载攻击和诱饵攻击)时,人类-AI 合作的作用。

关键词

引用

@article{arxiv.2504.17006,
  title  = {A Systematic Approach to Design Real-World Human-in-the-Loop Deep Reinforcement Learning: Salient Features, Challenges and Trade-offs},
  author = {Jalal Arabneydi and Saiful Islam and Srijita Das and Sai Krishna Gottipati and William Duguay and Cloderic Mars and Matthew E. Taylor and Matthew Guzdial and Antoine Fagette and Younes Zerouali},
  journal= {arXiv preprint arXiv:2504.17006},
  year   = {2025}
}

备注

This is a result of the collaboration by JACOBB, AMII(Alberta Machine Intelligence Institute), Thales and AI Redefined (AIR) in 2021-2023