单一策略的 OOD 泛化:SPARC 在 100 个未见车辆的赛跑中
机器学习
2025-11-14 v1 人工智能
摘要
向未见环境进行泛化是机器人和控制领域的重要挑战。本文聚焦于情境强化学习,其中智能体在具有不同情境的环境中行动,例如自主驾驶汽车或四足动物机器人,需要在与训练时不同的地形或天气条件下运行。我们解决的是在缺乏显式情境信息的测试时间下,对 OOD (out-of-distribution) 情境进行泛化的关键任务。最近的工作通过分别训练情境编码器和历史适应模块来解决此问题。虽然这种两阶段方法有前景,但实施和训练都颇具挑战性。我们简化了该方法论,提出 SPARC:单阶段适应以实现稳健控制。我们在高保真赛车模拟器 Gran Turismo 7 中的各种情境以及风扰动的 MuJoCo 环境中测试了 SPARC,发现其实现了可靠且稳健的 OOD 泛化。
引用
@article{arxiv.2511.09737,
title = {Out-of-Distribution Generalization with a SPARC: Racing 100 Unseen Vehicles with a Single Policy},
author = {Bram Grooten and Patrick MacAlpine and Kaushik Subramanian and Peter Stone and Peter R. Wurman},
journal= {arXiv preprint arXiv:2511.09737},
year = {2025}
}
备注
Accepted as an oral at AAAI 2026. For code and videos, please see https://github.com/bramgrooten/sparc