通过对比表征学习增强安全强化学习中的探索
机器学习
2025-04-29 v1 人工智能
摘要
在安全强化学习中, 智能体需要在探索动作与安全约束之间进行平衡. 遵循这一范式, 域迁移方法从相关环境中学习先验 Q 函数, 以防止不安全动作.然而, 由于大量假阳性结果, 一些安全动作永远不会被执行, 导致稀疏奖励环境中的探索不足.本文旨在学习一种高效的状态表征, 以在稀疏奖励环境中平衡探索与安全偏好动作.首先, 将图像输入映射到潜在表征空间;随后采用对比学习目标来区分安全与不安全状态.在学习阶段, 使用潜在距离构建额外的安全检查机制, 允许智能体在访问不安全状态时偏向探索.为验证本方法的有效性, 我们在三个基于导航的 MiniGrid 环境中进行实验.结果表明, 本方法能够在保持安全性与效率良好平衡的同时, 更好地探索环境.
引用
@article{arxiv.2503.10318,
title = {Enhance Exploration in Safe Reinforcement Learning with Contrastive Representation Learning},
author = {Duc Kien Doan and Bang Giang Le and Viet Cuong Ta},
journal= {arXiv preprint arXiv:2503.10318},
year = {2025}
}
备注
Accepted at ACIIDS 2025