Vejde:基于因子图着色细化的归纳深度强化学习框架
机器学习
2026-01-21 v2 人工智能
摘要
我们提出并评估了Vejde框架;该框架结合了数据抽象、图神经网络和强化学习,用于为具有丰富结构状态(如对象类别和关系)的决策问题生成归纳策略函数。MDP状态被表示为关于实体的事实数据库,Vejde将每个状态转换为二分图,通过神经消息传递映射到潜在状态。状态和动作的分解表示允许Vejde智能体处理规模和结构不同的问题。我们在八个由RDDL定义的领域中测试了Vejde智能体,每个领域有十个问题实例,通过监督学习和强化学习进行策略训练。为测试策略的泛化能力,我们将问题实例分为两个集合:一个用于训练,另一个仅用于测试。对未见实例的测试结果将Vejde智能体与在每个问题实例上训练的MLP智能体以及在线规划算法Prost进行比较。我们的结果表明,Vejde策略在平均情况下能够在没有显著得分下降的情况下对测试实例进行泛化。此外,归纳智能体在未见测试实例上的得分平均与实例特定的MLP智能体相当。
引用
@article{arxiv.2509.09219,
title = {Vejde: A Framework for Inductive Deep Reinforcement Learning Based on Factor Graph Color Refinement},
author = {Jakob Nyberg and Pontus Johnson},
journal= {arXiv preprint arXiv:2509.09219},
year = {2026}
}