SEMI:基于多感官不一致性的自监督探索
机器学习
2022-05-20 v2 机器人学
机器学习
摘要
高效探索是强化学习中的一个长期问题,因为外在奖励通常稀疏或缺失。对此问题的一个流行解决方案是向智能体提供新颖性信号作为内在奖励。本工作中,我们提出 SEMI,一种通过激励智能体最大化一种新的新颖性信号——多感官不一致性来进行自监督探索的策略,该信号可从两方面度量:感知不一致性与动作不一致性。前者表示多感官输入的错位,后者表示智能体在不同感官输入下策略的方差。具体而言,学习一个对齐预测器来检测多个感官输入是否对齐,其误差用于度量感知不一致性。一个策略模型以多感官观测的不同组合作为输入并输出动作用于探索。动作的方差进一步用于度量动作不一致性。将两种不一致性作为内在奖励,SEMI 使智能体能够以自监督方式在无任何外部奖励的情况下通过探索学习技能。我们进一步表明 SEMI 与外在奖励兼容,并提升了策略学习的样本效率。SEMI 的有效性在包括物体操控和视听游戏在内的多种基准环境中得到验证。
引用
@article{arxiv.2009.12494,
title = {SEMI: Self-supervised Exploration via Multisensory Incongruity},
author = {Jianren Wang and Ziwen Zhuang and Hang Zhao},
journal= {arXiv preprint arXiv:2009.12494},
year = {2022}
}
备注
Accepted at ICRA 2022