中文

强化学习受约束束搜索用于纸干工艺参数优化——在灵活约束下

机器学习 2025-01-23 v1 人工智能 系统与控制 系统与控制

摘要

现有的强化学习(RL)应用中约束设计的做法通常依赖于奖励函数中的训练时惩罚或训练/推理时无效动作掩码,但这些方法要么无法在训练后修改,要么受限于可实现的约束类型。为此,我们提出一种强化学习受约束束搜索方法(Reinforcement Learning Constrained Beam Search, RLCBS),用于组合优化问题的推理时细化。该方法支持灵活的推理时约束,包括排除无效动作和强制包含期望动作的功能,并采用束搜索最大化序列概率以实现更合理的约束整合。RLCBS 可扩展至不需要实时求解的基于 RL 的规划和优化问题。我们将其应用于新型模块化纸干测试平台的参数优化。训练一个 RL 智能体以在不同机器速度水平下最小化能耗,通过生成最优干燥模块和空气供给温度配置来实现。结果表明,RLCBS 在干燥模块配置复杂约束下的推理时性能显著优于 NSGA-II,同时实现了 2.58 倍以上的速度提升。

关键词

引用

@article{arxiv.2501.12542,
  title  = {Reinforcement Learning Constrained Beam Search for Parameter Optimization of Paper Drying Under Flexible Constraints},
  author = {Siyuan Chen and Hanshen Yu and Jamal Yagoobi and Chenhui Shao},
  journal= {arXiv preprint arXiv:2501.12542},
  year   = {2025}
}