用语言模型以自然语言解释黑盒文本模块
人工智能
2023-11-16 v2 计算与语言
机器学习
神经元与认知
摘要
大语言模型(LLMs)已在日益增长的任务中展现出卓越的预测性能。然而,它们的快速扩散和日益不透明性造成了对可解释性的迫切需求。在此,我们探讨能否自动获取黑盒文本模块的自然语言解释。"文本模块"是指任何将文本映射到标量连续值的函数,例如 LLM 内部的子模块或某个脑区的拟合模型。"黑盒"表示我们仅能访问该模块的输入/输出。我们提出 Summarize and Score(SASC)方法,该方法接收一个文本模块并返回关于该模块选择性的自然语言解释以及解释可靠性的评分。我们在 3 种情境下研究 SASC。首先,我们在合成模块上评估 SASC,发现它常能恢复真实解释。其次,我们使用 SASC 解释预训练 BERT 模型中发现的模块,从而实现对模型内部的检视。最后,我们展示 SASC 能为单个 fMRI 体素对语言刺激的反应生成解释,在精细脑图谱绘制方面具有潜在应用。使用 SASC 及复现结果的所有代码已在 Github 上公开。
引用
@article{arxiv.2305.09863,
title = {Explaining black box text modules in natural language with language models},
author = {Chandan Singh and Aliyah R. Hsu and Richard Antonello and Shailee Jain and Alexander G. Huth and Bin Yu and Jianfeng Gao},
journal= {arXiv preprint arXiv:2305.09863},
year = {2023}
}