中文

模仿学习中的泛化量化

机器学习 2025-09-30 v1 人工智能

摘要

模仿学习基准通常在训练和评估之间缺乏足够的变化,限制了对泛化能力的有意义评估。我们引入了Labyrinth,这是一个基准测试环境,旨在通过精确控制结构、起点和目标位置以及任务复杂度来测试泛化能力。它能够提供可验证的、互不相同的训练、评估和测试设置。Labyrinth提供了一个离散的、完全可观测的状态空间和已知的最优动作,支持可解释性和细粒度评估。其灵活的设置允许对泛化因素进行针对性测试,并包含部分可观测性、钥匙与门任务以及冰面危险等变体。通过实现可控、可复现的实验,Labyrinth推进了模仿学习中泛化能力的评估,并为开发更鲁棒的智能体提供了有价值的工具。

关键词

引用

@article{arxiv.2509.24784,
  title  = {Quantifying Generalisation in Imitation Learning},
  author = {Nathan Gavenski and Odinaldo Rodrigues},
  journal= {arXiv preprint arXiv:2509.24784},
  year   = {2025}
}

备注

NeurIPS 2025 Datasets and Benchmarks Track poster