Eval-PPO:使用近端策略优化构建高效威胁评估器
机器学习
2025-04-28 v2
摘要
在各种游戏场景中,从多个敌方单位中选定固定数量的目标是一项极具挑战性的任务。这种困难源于敌方单位的威胁等级与其特征特性之间的复杂关系,这使得基于规则的评估器的设计变得复杂。此外,当将此威胁评估问题应用于传统监督学习方法时,面临训练过程中缺乏显式标签的挑战。在本研究中,我们将威胁评估问题重新定义为强化学习任务,并引入了一种高效的评估器训练算法 Eval-PPO,该算法基于近端策略优化(PPO)算法。Eval-PPO 通过系统训练整合多维敌方特征和友方单位的状态信息,从而实现精确的威胁评估。与基于规则的方法相比,Eval-PPO 在平均成功率上表现出显著提升,增幅达 17.84%。
引用
@article{arxiv.2503.12098,
title = {Eval-PPO: Building an Efficient Threat Evaluator Using Proximal Policy Optimization},
author = {Wuzhou Sun and Siyi Li and Qingxiang Zou and Zixing Liao},
journal= {arXiv preprint arXiv:2503.12098},
year = {2025}
}
备注
The research content is not yet complete and requires further supplementation and improvement