中文

基于约束环境中连续动作的强化学习动作映射

计算与语言 2024-12-06 v1 人工智能 计算机与社会

摘要

深度强化学习 (DRL) 在 various 领域取得了成功,但将其应用于具有约束的环境仍具有挑战性,由于样本效率差和收敛缓慢。近期文献探索了通过整合模型知识来缓解这些问题,特别是利用评估提议动作可行性的模型。然而,在连续动作空间中将可行性模型高效集成到 DRL 管道中并不容易。我们提出了一种新颖的 DRL 训练策略,利用动作映射技术充分利用可行性模型以简化学习过程。通过将可行动作的学习与策略优化分离,动作映射允许 DRL 智能体从已减小的可行动作集合中选择最优动作。我们通过实验表明,动作映射在具有连续动作空间的受约束环境中显著提高了训练性能,尤其是在不可靠的可行性模型下。

关键词

引用

@article{arxiv.2412.04326,
  title  = {Understanding Student Sentiment on Mental Health Support in Colleges Using Large Language Models},
  author = {Palak Sood and Chengyang He and Divyanshu Gupta and Yue Ning and Ping Wang},
  journal= {arXiv preprint arXiv:2412.04326},
  year   = {2024}
}

备注

Accepted by '2024 IEEE International Conference on Big Data (IEEE BigData 2024)'. The paper has 8 pages, 2 figures, 4 tables