观测代价敏感强化学习中的动态观测策略
机器学习
2024-04-22 v3 人工智能
摘要
强化学习(RL)已被证明能够为复杂任务(包括游戏、机器人、供暖与制冷系统以及文本生成)学习精细的控制策略。然而,RL 中的动作-感知循环通常假设在每个时间步都可无代价地获得对环境状态的测量。但在材料设计、深海与行星机器人探索以及医学等应用中,测量甚至近似环境状态可能伴随高昂代价。本文中,我们综述了近期日益增多的文献,这些文献采纳这样一种观点:RL 智能体可能并不需要、甚至不希望在每个时间步都进行代价高昂的测量。在此背景下,我们提出了深度动态多步无观测智能体(DMSOA),将其与已有文献进行对比,并在 OpenAI gym 与 Atari Pong 环境中进行实证评估。我们的结果表明,与文献中考虑的可选方案相比,DMSOA 以更少的决策步数与测量次数学习到了更优的策略。
引用
@article{arxiv.2307.02620,
title = {Dynamic Observation Policies in Observation Cost-Sensitive Reinforcement Learning},
author = {Colin Bellinger and Mark Crowley and Isaac Tamblyn},
journal= {arXiv preprint arXiv:2307.02620},
year = {2024}
}
备注
NeurIPS 2023 Workshop WANT