基于集成梯度与语言学分析的可解释大语言模型方法
计算与语言
2024-10-02 v1
摘要
影响语言生产的神经系统障碍,如阿尔茨海默病(AD),对患者和照护者都具有重大影响,无论是通过社交、心理情感方面,或其他尚未完全理解的方面。近期大语言模型(LLM)架构的发展已开发出许多工具,用于通过自然语言识别神经障碍的代表性特征。然而,LLM 通常缺乏可解释性,即不提供其决策的明确且具体的原因。因此,亟需一种能够识别神经障碍在语言中代表性特征并清晰解释这些特征为何相关的方法。本文提出一种可解释 LLM 方法,命名为 SLIME(统计与语言学洞察模型解释),能够识别代表 AD 的词汇成分,并指示哪些成分对 LLM 决策最为重要。在开发该方法时,我们使用由 Cookie Theft 图像描述任务转录组成的英语语言数据集。LLM 双向编码器表示Transformer(BERT)将文本描述分类为 AD 或对照组。为识别代表性词汇特征并确定哪些特征对模型决策最为关键,我们采用包括集成梯度(IG)、语言学查询与单词计数(LIWC)和统计分析在内的管道。我们的方法证明,BERT 利用反映 AD 中社交引用减少的词汇成分,并识别进一步提高 LLM 准确率的特征。因此,我们提供了一个增强信心的可解释性工具,适用于神经临床背景,尤其是神经退行性疾病研究。
引用
@article{arxiv.2410.00250,
title = {A Methodology for Explainable Large Language Models with Integrated Gradients and Linguistic Analysis in Text Classification},
author = {Marina Ribeiro and Bárbara Malcorra and Natália B. Mota and Rodrigo Wilkens and Aline Villavicencio and Lilian C. Hubner and César Rennó-Costa},
journal= {arXiv preprint arXiv:2410.00250},
year = {2024}
}
备注
27 pages, 6 figures, authors Marina Ribeiro and B\'arbara Malcorra have equal contribution, C\'esar Renn\'o-Costa is the corresponding author