基于自动辅助损失搜索的强化学习
机器学习
2022-10-13 v1
摘要
良好的状态表示对解决复杂强化学习(RL)挑战至关重要。许多近期工作聚焦于设计辅助损失以学习信息丰富的表示。遗憾的是,这些手工目标严重依赖专家知识且可能次优。本文提出一种原则性且通用的方法,利用辅助损失函数学习更好的表示,称为自动辅助损失搜索(A2LS),其自动搜索 RL 中性能最优的辅助损失函数。具体而言,基于收集的轨迹数据,我们定义了规模为 的通用辅助损失空间,并采用高效进化搜索策略探索该空间。实证结果表明,所发现的辅助损失(即 A2-winner)以更高效率显著提升了高维(图像)与低维(向量)未知任务的性能,展现出对不同设置甚至不同基准领域的良好泛化能力。我们进行了统计分析以揭示辅助损失模式与 RL 性能间的关系。
引用
@article{arxiv.2210.06041,
title = {Reinforcement Learning with Automated Auxiliary Loss Search},
author = {Tairan He and Yuge Zhang and Kan Ren and Minghuan Liu and Che Wang and Weinan Zhang and Yuqing Yang and Dongsheng Li},
journal= {arXiv preprint arXiv:2210.06041},
year = {2022}
}
备注
NeurIPS 2022 accepted paper