神经 DNF-MT:一种用于学习可解释且可编辑策略的神经符号方法
人工智能
2025-04-25 v4 机器学习
计算机科学中的逻辑
摘要
尽管深度强化学习被证明有效,但其黑箱本质为直接策略解释带来了障碍。为此,我们提出一种神经符号方法,称为 neural DNF-MT,用于端到端策略学习。neural DNF-MT 模型的可微特性使其能够用于深度 actor-critic 算法进行训练。同时,其架构设计使得训练后的模型可直接翻译为以标准 (二值或概率) 逻辑程序表达的可解释策略。此外,可以包含额外的层从复杂观察中提取抽象特征,作为谓词发明的形式。逻辑表示高度可解释,我们展示了确定性策略的二值表示如何被编辑并重新导入神经模型中,以促进对已学习策略的人工干预和适应。我们在一系列需要从各种形式观察中学习确定性或随机行为的任务上进行评估。我们的实验结果表明,neural DNF-MT 模型在保持与竞争性黑箱方法相当水平的同时,提供了可解释的策略。
引用
@article{arxiv.2501.03888,
title = {Neural DNF-MT: A Neuro-symbolic Approach for Learning Interpretable and Editable Policies},
author = {Kexin Gu Baugh and Luke Dickens and Alessandra Russo},
journal= {arXiv preprint arXiv:2501.03888},
year = {2025}
}
备注
AAMAS 2025 (with Appendix)