中文

在训练中利用 LLM 增强可解释模型

人工智能 2023-12-05 v3 计算与语言 机器学习 统计方法学

摘要

近期大语言模型(LLM)在日益增多的任务中展现出卓越的预测性能。然而,它们向高风险领域(如医学)和计算受限环境的扩散,催生了对可解释性和效率的迫切需求。我们通过提出增强可解释模型(Aug-imodels)来满足该需求,这是一个利用 LLM 所学知识构建极高效率和可解释模型的框架。Aug-imodels 在拟合期间而非推理期间使用 LLM,从而实现完全透明,且推理速度与内存通常比 LLM 提升 1,000 倍以上。我们在自然语言处理中探索了 Aug-imodels 的两种实例化:(i)Aug-GAM,用 LLM 的解耦嵌入增强广义加性模型;(ii)Aug-Tree,用 LLM 特征扩展增强决策树。在多种文本分类数据集上,两者均优于其未增强的对应模型。Aug-GAM 甚至可优于大得多的模型(如 60 亿参数的 GPT-J 模型),尽管其参数少 10,000 倍且完全透明。我们进一步在自然语言 fMRI 研究中探索 Aug-imodels,其从科学数据中生成有趣的解释。所有用于使用 Aug-imodels 和复现结果的代码已在 Github 上公开。

关键词

引用

@article{arxiv.2209.11799,
  title  = {Augmenting Interpretable Models with LLMs during Training},
  author = {Chandan Singh and Armin Askari and Rich Caruana and Jianfeng Gao},
  journal= {arXiv preprint arXiv:2209.11799},
  year   = {2023}
}