相对熵正则化强化学习用于高效加密策略合成
机器学习
2025-06-17 v1 系统与控制
系统与控制
摘要
我们提出了一种高效的加密策略合成方法,用于开发隐私保护的基于模型的强化学习。我们首先证明,相对熵正则化强化学习框架为值迭代提供了计算方便的线性和'无最小化'结构,使得全同态加密与自举可以直接高效地集成到策略合成中。在加密策略合成传播加密引入的误差(包括量化和自举)时,收敛性和误差界限得到了分析。理论分析通过数值模拟得到验证。结果证明了 RERL 框架在将全同态加密集成到加密策略合成中的有效性。
引用
@article{arxiv.2506.12358,
title = {Relative Entropy Regularized Reinforcement Learning for Efficient Encrypted Policy Synthesis},
author = {Jihoon Suh and Yeongjun Jang and Kaoru Teranishi and Takashi Tanaka},
journal= {arXiv preprint arXiv:2506.12358},
year = {2025}
}
备注
6 pages, 2 figures, Published in IEEE Control Systems Letters, June 2025