主动采样能否减少离线强化学习中的因果混淆?
机器学习
2023-12-29 v1 人工智能
摘要
因果混淆是一种现象,即智能体学到的策略反映了数据中不完美的虚假相关性。如果大多数训练数据包含此类虚假相关性,这种策略在训练期间可能虚假地表现为最优。这种现象在机器人等领域尤为明显,可能导致智能体的开环与闭环性能之间存在巨大差距。在此类设置中,因果混淆的模型在训练期间根据开环指标可能表现良好,但在现实世界部署时却会灾难性地失败。在本文中,我们研究了离线强化学习中的因果混淆。我们调查了是否有选择地从演示数据集中采样适当的点,能使离线强化学习智能体消除环境底层因果机制的歧义,缓解离线强化学习中的因果混淆,并产生更安全的部署模型。为回答这一问题,我们考虑了一组定制的展现因果模糊性的离线强化学习数据集,并评估了主动采样技术在评估阶段减少因果混淆的能力。我们提供了实证证据,表明均匀采样和主动采样技术能够随着训练的进行一致地减少因果混淆,且主动采样在此方面比均匀采样效率高得多。
引用
@article{arxiv.2312.17168,
title = {Can Active Sampling Reduce Causal Confusion in Offline Reinforcement Learning?},
author = {Gunshi Gupta and Tim G. J. Rudner and Rowan Thomas McAllister and Adrien Gaidon and Yarin Gal},
journal= {arXiv preprint arXiv:2312.17168},
year = {2023}
}
备注
Published in Proceedings of the 2nd Conference on Causal Learning and Reasoning (CLeaR 2021)