NiceWebRL:用于强化学习环境中人物主体实验的 Python 库
人工智能
2025-08-22 v1
摘要
我们提出了 NiceWebRL,这是一个研究工具,使研究人员能够使用机器人强化学习(RL)环境进行在线人物主体实验。NiceWebRL 是一个 Python 库,允许将任何基于 Jax 的环境转换为在线界面,支持单主体和多主体环境。因此,NiceWebRL 使 AI 研究人员能够将其算法与人类表现进行比较,认知科学家能够将 ML 算法作为人类认知的理论进行测试,多主体研究人员能够开发用于人类与 AI 协作的算法。我们通过 3 个案例研究展示了 NiceWebRL 的潜力,以帮助开发类人 AI、类人兼容 AI 和类人辅助 AI。在第一个案例研究(类人 AI)中,NiceWebRL 使开发人员能够开发出一种新颖的认知 RL 模型。在这里,NiceWebRL 促进了在网格世界和 Craftax(一种 2D Minecraft 领域)中对人类参与者进行测试。在我们的第二个案例研究(类人兼容 AI)中,NiceWebRL 使开发人员能够开发出一种可对人类合作伙伴进行泛化的新型多主体 RL 算法。在我们的第三个案例研究(类人辅助 AI)中,我们展示了 NiceWebRL 如何允许研究人员在 XLand-Minigrid 环境中研究 LLM 如何协助人类处理复杂任务,该环境包含数以百万计的层次化任务。该库可在 https://github.com/KempnerInstitute/nicewebrl 上获得。
引用
@article{arxiv.2508.15693,
title = {NiceWebRL: a Python library for human subject experiments with reinforcement learning environments},
author = {Wilka Carvalho and Vikram Goddla and Ishaan Sinha and Hoon Shin and Kunal Jha},
journal= {arXiv preprint arXiv:2508.15693},
year = {2025}
}