强化学习低层无人机控制中的动态熵调节:随机性与确定性之比较
机器人学
2025-12-23 v1 人工智能
机器学习
摘要
本文探讨了动态熵调节在强化学习(RL)算法中对采用随机策略的影响,其性能与采用确定性策略的算法进行比较。随机策略通过优化动作上的概率分布以最大化奖励,而确定性策略则根据状态选择单个确定性动作。本文探讨了使用静态熵和动态熵训练随机策略后,再执行确定性动作来控制无人机的效果,并将其与训练确定性策略并执行确定性动作进行比较。为本研究选择了Soft Actor-Critic (SAC)算法作为随机算法,而Twin Delayed Deep Deterministic Policy Gradient (TD3)作为确定性算法。训练和仿真结果表明,动态熵调节对控制无人机具有积极影响,通过防止灾难性遗忘并提高探索效率。
引用
@article{arxiv.2512.18336,
title = {Dynamic Entropy Tuning in Reinforcement Learning Low-Level Quadcopter Control: Stochasticity vs Determinism},
author = {Youssef Mahran and Zeyad Gamal and Ayman El-Badawy},
journal= {arXiv preprint arXiv:2512.18336},
year = {2025}
}
备注
This is the Author Accepted Manuscript version of a paper accepted for publication. The final published version is available via IEEE Xplore