中文

熄灯:训练对暂时性失明具有鲁棒性的强化学习智能体

人工智能 2023-12-06 v1 机器学习

摘要

使用 DQN 训练的智能体依赖每个时间步的观测来决定下一步采取何种动作。然而,在现实世界应用中,观测可能会改变或完全缺失。例如,灯泡损坏或某个房间的壁纸发生变化。虽然这些情况改变了实际观测,但底层的最优策略并未改变。因此,我们希望智能体能够继续采取动作,直到再次接收到(可识别的)观测。为实现这一点,我们引入了一种组合方法,包括使用观测隐藏表示的神经网络架构和一个新颖的 n 步损失函数。我们的实现能够承受比训练时所经历的更长的基于位置的失明时段,因此展示了对暂时性失明的鲁棒性。如需访问我们的实现,请发送电子邮件给 Nathan、Marije 或 Pau。

关键词

引用

@article{arxiv.2312.02665,
  title  = {Lights out: training RL agents robust to temporary blindness},
  author = {N. Ordonez and M. Tromp and P. M. Julbe and W. Böhmer},
  journal= {arXiv preprint arXiv:2312.02665},
  year   = {2023}
}