中文

Eval-PPO:使用近端策略优化构建高效威胁评估器

机器学习 2025-04-28 v2

摘要

在各种游戏场景中,从多个敌方单位中选定固定数量的目标是一项极具挑战性的任务。这种困难源于敌方单位的威胁等级与其特征特性之间的复杂关系,这使得基于规则的评估器的设计变得复杂。此外,当将此威胁评估问题应用于传统监督学习方法时,面临训练过程中缺乏显式标签的挑战。在本研究中,我们将威胁评估问题重新定义为强化学习任务,并引入了一种高效的评估器训练算法 Eval-PPO,该算法基于近端策略优化(PPO)算法。Eval-PPO 通过系统训练整合多维敌方特征和友方单位的状态信息,从而实现精确的威胁评估。与基于规则的方法相比,Eval-PPO 在平均成功率上表现出显著提升,增幅达 17.84%。

关键词

引用

@article{arxiv.2503.12098,
  title  = {Eval-PPO: Building an Efficient Threat Evaluator Using Proximal Policy Optimization},
  author = {Wuzhou Sun and Siyi Li and Qingxiang Zou and Zixing Liao},
  journal= {arXiv preprint arXiv:2503.12098},
  year   = {2025}
}

备注

The research content is not yet complete and requires further supplementation and improvement