Toward a Metrology for Artificial Intelligence: Hidden-Rule Environments and Reinforcement Learning
机器学习
2025-10-24 v3 人工智能
机器学习
摘要
我们探讨了在 Game Of Hidden Rules (GOHR) 环境中的强化学习,该环境是一个复杂的谜题,要求智能体推断并执行隐藏规则,以将 66 棋盘上的棋子放入桶中。我们研究了两种状态表示策略,即基于特征的 (Feature-Centric, FC) 和基于对象的 (Object-Centric, OC),并采用基于 Transformer 的 Advantage Actor-Critic (A2C) 算法进行训练。该代理仅获得部分观察,必须通过经验同时推断主导规则并学习最优策略。我们在多种基于规则和基于试验列表的实验设置中评估了模型,分析了迁移效应和表示对学习效率的影响。
关键词
引用
@article{arxiv.2509.06213,
title = {Toward a Metrology for Artificial Intelligence: Hidden-Rule Environments and Reinforcement Learning},
author = {Christo Mathew and Wentian Wang and Jacob Feldman and Lazaros K. Gallos and Paul B. Kantor and Vladimir Menkov and Hao Wang},
journal= {arXiv preprint arXiv:2509.06213},
year = {2025}
}