面向Web搜索匹配计划生成的分参数化动作演员-评论家强化学习算法比较分析
机器学习
2025-10-06 v1 人工智能
摘要
本研究评估了Soft Actor Critic (SAC)、Greedy Actor Critic (GAC)和Truncated Quantile Critics (TQC)在完全可观测环境中处理高维决策任务的性能。关注点在于分参数化动作 (PA) 空间,无需循环网络即可实现。以Platform-v0和Goal-v0为基准,测试与连续动作参数空间关联的离散动作。采用Microsoft NNI进行超参数优化,为保证可重复性,对GAC和TQC的代码进行了修改。结果表明,分参数化Greedy Actor-Critic (PAGAC) 在基准测试中表现优异,实现了最快的训练速度和最高的回报,分别在Platform游戏中用41分24秒完成5000回合,在Robot Soccer Goal游戏中用24分04秒完成。其速度与稳定性在复杂动作空间中提供了明显优势。与PASAC和PATQC相比,PAGAC在效率和可靠性方面均表现出色,适合需要快速收敛和稳健性能的任务。未来工作可探索结合熵正则化与截断方法的混合策略,以提升稳定性并拓展可泛化性研究。
引用
@article{arxiv.2510.03064,
title = {Comparative Analysis of Parameterized Action Actor-Critic Reinforcement Learning Algorithms for Web Search Match Plan Generation},
author = {Ubayd Bapoo and Clement N Nyirenda},
journal= {arXiv preprint arXiv:2510.03064},
year = {2025}
}
备注
10 pages, 10th International Congress on Information and Communication Technology (ICICT 2025)