中文

PyTupli:面向协作式离线强化学习项目的可扩展基础设施

机器学习 2025-05-26 v2

摘要

离线强化学习 (RL) 因能够从预收集的数据中学习控制策略而迎来广泛关注,无需进行代价高昂或风险较大的在线交互。虽然许多开源库提供了稳健的离线 RL 算法实现,但它们都依赖于由状态、动作、下一个状态和奖励组成的经验元组构成的数据集。管理、策划和分发此类数据集需要合适的基础设施。虽然已有静态数据集可供成熟基准问题使用,但没有标准化或可扩展的解决方案支持开发和共享新基准或用户自定义基准的数据集。为此,我们引入 PyTupli,这是一个基于 Python 的工具,用于简化基准环境及其相应元组数据集的创建、存储和分发。PyTupli 包括一个轻量级客户端库,提供用于上传和检索基准和数据的接口。它支持episode 级别和元组级别的细粒度过滤,允许研究人员策划高质量、任务特定的数据集。容器化服务器组件支持生产就绪部署,包括身份验证、访问控制以及自动证书 provisioning,以实现安全使用。通过解决数据集基础设施中的关键障碍,PyTupli 促进了更协作、更可重复、更可扩展的离线 RL 研究。

关键词

引用

@article{arxiv.2505.16754,
  title  = {PyTupli: A Scalable Infrastructure for Collaborative Offline Reinforcement Learning Projects},
  author = {Hannah Markgraf and Michael Eichelbeck and Daria Cappey and Selin Demirtürk and Yara Schattschneider and Matthias Althoff},
  journal= {arXiv preprint arXiv:2505.16754},
  year   = {2025}
}