神经符号动作掩码:深度强化学习中的符号化动作约束
人工智能
2026-02-12 v1 机器学习
摘要
深度强化学习(DRL)在训练和执行期间可能探索不可行动作。现有方法假设一种符号 grounding 函数,将高维状态映射到一致的符号表征,并使用手动指定的动作掩码技术来约束动作。本文提出神经符号动作掩码(Neuro-symbolic Action Masking, NSAM),一种新型框架,能够在DRL过程中以最小监督方式自动学习与高维状态给定域约束一致的符号模型。基于所学习的状态符号模型,NSAM学习动作掩码,以排除不可行动作。NSAM实现了符号推理与深度策略优化的端到端集成,符号 grounding 与策略学习的改进相互强化。我们在具有约束的多个领域上评估了NSAM,实验结果表明,NSAM显著提高了DRL代理的样本效率,同时大幅减少约束违规。
引用
@article{arxiv.2602.10598,
title = {Neuro-symbolic Action Masking for Deep Reinforcement Learning},
author = {Shuai Han and Mehdi Dastani and Shihan Wang},
journal= {arXiv preprint arXiv:2602.10598},
year = {2026}
}