中文

基于自动辅助损失搜索的强化学习

机器学习 2022-10-13 v1

摘要

良好的状态表示对解决复杂强化学习(RL)挑战至关重要。许多近期工作聚焦于设计辅助损失以学习信息丰富的表示。遗憾的是,这些手工目标严重依赖专家知识且可能次优。本文提出一种原则性且通用的方法,利用辅助损失函数学习更好的表示,称为自动辅助损失搜索(A2LS),其自动搜索 RL 中性能最优的辅助损失函数。具体而言,基于收集的轨迹数据,我们定义了规模为 7.5×10207.5 \times 10^{20} 的通用辅助损失空间,并采用高效进化搜索策略探索该空间。实证结果表明,所发现的辅助损失(即 A2-winner)以更高效率显著提升了高维(图像)与低维(向量)未知任务的性能,展现出对不同设置甚至不同基准领域的良好泛化能力。我们进行了统计分析以揭示辅助损失模式与 RL 性能间的关系。

关键词

引用

@article{arxiv.2210.06041,
  title  = {Reinforcement Learning with Automated Auxiliary Loss Search},
  author = {Tairan He and Yuge Zhang and Kan Ren and Minghuan Liu and Che Wang and Weinan Zhang and Yuqing Yang and Dongsheng Li},
  journal= {arXiv preprint arXiv:2210.06041},
  year   = {2022}
}

备注

NeurIPS 2022 accepted paper