中文

面向跨域适应的具规制行为模式的开环多样解发现

机器学习 2023-05-23 v2 人工智能

摘要

尽管强化学习可在复杂任务上取得令人印象深刻的成果,所学策略通常易在具微小模型失配或意外扰动的下游任务中失败。近期工作表明,具多样行为特征的策略群体可泛化至具各类差异的下游环境。然而,因训练策略行为不受限制,此类策略在真实世界系统等实际场景部署中可能导致灾难性损害。此外,无行为规制的多样策略训练,可能导致可行策略不足,难以外推至具动态偏移的广泛测试条件。本文旨在行为模式正则下训练多样策略。我们通过观察部分状态信息环境的逆动力学引出范式,提出 Diversity in Regulation(DiR),训练具规制行为的多样策略以发现有益于泛化的期望模式。在不同环境多种变体上的大量实证结果表明,该方法优于其他多样性驱动方法。

关键词

引用

@article{arxiv.2209.12029,
  title  = {Open-Ended Diverse Solution Discovery with Regulated Behavior Patterns for Cross-Domain Adaptation},
  author = {Kang Xu and Yan Ma and Bingsheng Wei and Wei Li},
  journal= {arXiv preprint arXiv:2209.12029},
  year   = {2023}
}