中文

自然语言中的内在可解释强化学习

人机交互 2022-10-10 v3 人工智能 计算与语言

摘要

我们聚焦于创建一种内在可解释的强化学习智能体的任务——其能够通过边执行任务边自言自语产生即时局部解释,并事后分析整条轨迹以产生因果解释。这种分层可解释强化学习智能体(HEX-RL)在交互式小说中运行,即基于文本的游戏环境,其中智能体使用文本自然语言感知世界并对其施加动作。这些游戏通常构造为具有长期依赖的谜题或任务,智能体必须完成一系列动作才能成功——提供了测试智能体解释其动作能力的理想环境。我们的智能体将可解释性视为一等公民来设计,使用提取的符号知识图状态表示,并结合分层图注意力机制,该机制指向内部图表示中最影响动作选择的事实。实验表明,由通常不熟悉该环境的人类参与者评定,该智能体相比强基线提供了显著改进的解释,同时也达到了最先进的任务表现。

关键词

引用

@article{arxiv.2112.08907,
  title  = {Inherently Explainable Reinforcement Learning in Natural Language},
  author = {Xiangyu Peng and Mark O. Riedl and Prithviraj Ammanabrolu},
  journal= {arXiv preprint arXiv:2112.08907},
  year   = {2022}
}