概念层:通过 LLM 概念化增强可解释性与可干预性
机器学习
2025-02-20 v1 人工智能
计算与语言
摘要
大语言模型(LLM)的不透明性引发了旨在增强其可解释性的大量研究工作,主要采用事后方法。较新的内在方法,如概念瓶颈模型(CBM),通过引入显式概念表示,同时提供了可解释性和可干预性。然而,这些方法存在关键局限性,包括依赖带标签的概念数据集以及阻碍其重新集成到现有系统流水线中的重大架构修改。在本工作中,我们引入了一种新方法,通过将概念层集成到现有模型的架构中,为其赋予可解释性和可干预性。我们的方法将模型的内部向量表示投影到一个概念化、可解释的向量空间中,然后重构并将其反馈回模型。此外,我们通过在本体中算法搜索一组既可以是特定任务也可以是任务无关的概念,消除了对人工选择概念集的需求。我们在多个任务上评估了概念层,证明它们在保持原始模型性能和一致性的同时,能够实现有意义的干预。此外,我们展示了一个概念验证,展示了一个可干预性接口,允许用户动态调整模型行为,例如在推理过程中缓解偏见。
引用
@article{arxiv.2502.13632,
title = {Concept Layers: Enhancing Interpretability and Intervenability via LLM Conceptualization},
author = {Or Raphael Bidusa and Shaul Markovitch},
journal= {arXiv preprint arXiv:2502.13632},
year = {2025}
}