中文

基于后验与多样性协同的任务抽样:面向随机环境中自适应决策者

机器学习 2025-05-16 v3 人工智能 机器学习

摘要

任务鲁棒适应是序列决策中的长期目标。某些风险怠慢策略(如条件价值-at-risk 原则)被集成到域随机化或元强化学习中,以优先处理优化中的困难任务,这要求昂贵的密集评估。效率问题促使开发鲁棒主动任务抽样以训练自适应策略,其中用于预测风险的模型用于替代策略评估。本工作将鲁棒主动任务抽样的优化管道建模为马尔可夫决策过程,提出理论与实践见解,构建风险怠慢情景下的鲁棒性概念。重要的是,我们提出一种易于实现的方法,即后验与多样性协同任务抽样(Posterior and Diversity Synergized Task Sampling, PDTS),以适应快速且鲁棒的序列决策。大量实验表明,PDTS 充分发挥了鲁棒主动任务抽样的潜力,显著提升了在挑战性任务中的零样本和少样本适应鲁棒性,甚至在某些情境下加速学习过程。我们的项目网页位于 https://thu-rllab.github.io/PDTS_project_page。

关键词

引用

@article{arxiv.2504.19139,
  title  = {Fast and Robust: Task Sampling with Posterior and Diversity Synergies for Adaptive Decision-Makers in Randomized Environments},
  author = {Yun Qu and Qi Cheems Wang and Yixiu Mao and Yiqin Lv and Xiangyang Ji},
  journal= {arXiv preprint arXiv:2504.19139},
  year   = {2025}
}

备注

ICML 2025