LICORICE:面向可解释强化学习的标签高效概念基方法
机器学习
2025-03-21 v2 人工智能
摘要
近期强化学习(RL)的进展主要依赖神经网络策略进行决策,但这些模型常缺乏可解释性,给利益相关者的理解和信任带来挑战。概念瓶颈模型提供了一种可解释的替代方案,通过将人类可理解的概念集成到策略中。然而,先前工作假设在训练期间可获得概念注释。这一要求对 RL 构成了显著限制:它需要持续实时地对概念进行注释,这种做法要么给人类标注者带来不切实际的负担,要么在采用自动标注方法时会产生巨大的 API 调用和推理成本。为克服这一限制,我们引入一种新颖的训练方案,使 RL 代理仅通过查询标注者对小数据集进行标签标注,即可高效学习概念基策略。我们的算法 LICORICE 包含三个主要贡献:交替进行概念学习和 RL 训练,使用集成主动选择具有信息量的数据点进行标注,以及解除概念数据之间的相关性。我们展示了 LICORICE 在三个环境中将人类标注工作减少到 500 个以内,在两个更复杂的环境中减少到 5000 个以内,所有情况下都不损害性能。我们还探讨了使用视觉语言模型作为自动概念标注器的可能性,发现其在某些情况下有效,但在其他情况下不够完美。我们的工作显著降低了可解释 RL 的标注负担,使其在需要透明度的实际应用中更加实用。
引用
@article{arxiv.2407.15786,
title = {LICORICE: Label-Efficient Concept-Based Interpretable Reinforcement Learning},
author = {Zhuorui Ye and Stephanie Milani and Geoffrey J. Gordon and Fei Fang},
journal= {arXiv preprint arXiv:2407.15786},
year = {2025}
}
备注
Accepted at ICLR 2025