强化学习中奖励前瞻的价值
机器学习
2024-10-15 v2 机器学习
摘要
在强化学习(RL)中,智能体在与不断变化的环境进行序贯交互的同时,旨在最大化所获得的奖励。通常,奖励仅在行动之后才能观察到,因此目标是最大化期望累积奖励。然而,在许多实际场景中,奖励信息是提前观察到的——价格在进行交易前就已观察到;附近的交通信息部分已知;目标通常在与环境交互之前就已提供给智能体。在这项工作中,我们旨在通过竞争分析的视角,定量分析此类未来奖励信息的价值。具体而言,我们衡量标准RL智能体的价值与具有部分未来奖励前瞻能力的智能体的价值之间的比率。我们刻画了最坏情况下的奖励分布,并推导出最坏情况奖励期望的精确比率。令人惊讶的是,所得比率与离线RL和无奖励探索中的已知量有关。我们进一步给出了在最坏动态下该比率的紧确界。我们的结果涵盖了从在行动前观察到即时奖励到在交互开始前观察到所有奖励的整个频谱。
引用
@article{arxiv.2403.11637,
title = {The Value of Reward Lookahead in Reinforcement Learning},
author = {Nadav Merlis and Dorian Baudry and Vianney Perchet},
journal= {arXiv preprint arXiv:2403.11637},
year = {2024}
}
备注
Accepted to NeurIPS 2024 as spotlight