中文

按域泛化策略:高效且稳健的 Q 值函数学习(技术附录扩展版)

人工智能 2026-03-19 v1 机器学习

摘要

学习按域泛化的策略是规划中的关键挑战。标准方法使用基于监督学习的图神经网络状态价值函数,这些网络是在由教师规划器生成的最优计划上进行训练的。在本文中,我们倡议学习 Q 值函数。由于它们只需处理当前状态即可对给定状态进行评估,因此计算成本大幅降低。令人惊讶的是,基础监督学习的 Q 值学习表现不佳,因为它无法区分教师所采取的动作与未采取的动作。我们通过使用正则化项来解决这一问题,这些项强制实现这种区分, resulting in Q 值策略在 10 个域上 consistently outperform state-value policies,并与规划器 LAMA-first 竞争。

关键词

引用

@article{arxiv.2603.17544,
  title  = {Per-Domain Generalizing Policies: On Learning Efficient and Robust Q-Value Functions (Extended Version with Technical Appendix)},
  author = {Nicola J. Müller and Moritz Oster and Isabel Valera and Jörg Hoffmann and Timo P. Gros},
  journal= {arXiv preprint arXiv:2603.17544},
  year   = {2026}
}