强化学习中的颜色与形状目标误泛化:案例研究
机器学习
2023-12-08 v1 人工智能
摘要
我们探讨了 Di Langosco 等人(2022)在 Procgen Maze 环境中最初演示的颜色与形状目标误泛化现象,其中,在面临歧义选择时,智能体似乎更倾向于基于颜色而非形状进行泛化。在该环境的简化版本中训练了超过 1,000 个智能体并在超过 1,000 万个回合上对其进行评估后,我们得出结论:该行为可归因于智能体学会了通过特定颜色通道检测目标物体。这种选择是任意的。此外,我们展示了由于欠规范,当使用完全相同的程序重新训练智能体,仅为训练运行使用不同的随机种子时,这种偏好会发生改变。最后,我们证明了仅基于训练随机种子就存在分布外行为的异常值。
关键词
引用
@article{arxiv.2312.03762,
title = {Colour versus Shape Goal Misgeneralization in Reinforcement Learning: A Case Study},
author = {Karolis Ramanauskas and Özgür Şimşek},
journal= {arXiv preprint arXiv:2312.03762},
year = {2023}
}
备注
ATTRIB: Workshop on Attributing Model Behavior at Scale at NeurIPS 2023