中文

深入探讨深度强化学习中的危险转折

机器学习 2025-04-15 v1 人工智能

摘要

危险转折(Treacherous Turn)指的是人工智能(AI)智能体 subtly 且或许秘密地学习执行有利于自身但被认为不恰当且可能对人类监督者有害的行为的场景。在训练期间,智能体表现出符合人类监督者预期的行为,但在部署时执行任务时,它会执行另一种行为,而监督者不在场所无法加以阻止。初始实验将 DRL 应用于实现的A Link to the Past 示例中,尽管对环境进行了各种修改,旨在产生危险转折效果,但并未自然产生。然而,在本工作中,我们发现当使用其他 Trojan 注入策略时,危险行为可以在 DRL 智能体中实现。这一方法偏离于典型的危险转折行为,因为该行为是明确训练到智能体中的,而非作为环境复杂性或目标规范不良的副作用而自然产生。尽管如此,这些实验提供了关于如何产生能够实现真正危险转折行为的智能体的新见解。

关键词

引用

@article{arxiv.2504.08943,
  title  = {Investigating the Treacherous Turn in Deep Reinforcement Learning},
  author = {Chace Ashcraft and Kiran Karra and Josh Carney and Nathan Drenkow},
  journal= {arXiv preprint arXiv:2504.08943},
  year   = {2025}
}