将可解释人工智能技术与大语言模型集成以增强情感分析的可解释性
计算与语言
2025-03-18 v1 人工智能
摘要
可解释性是基于大语言模型(LLMs)进行情感分析的关键难题,尤其在需要理解预测理由的高风险应用中更为突出。本研究提出了一种方法,通过将 SHAP(Shapley 加性解释)应用于将 LLMs 分解为嵌入层、编码器、解码器和注意力层等组件,从而提供逐层的情感预测知识。该方法通过将 LLMs 拆分为这些部分,清晰地展示了模型如何解释和分类情感。该方法在斯坦福情感树库(SST-2)数据集上进行评估,展示了不同句子如何影响不同层。实验评估证明了逐层 SHAP 分析在澄清情感特定 token 归因方面的有效性,相比现有的整体模型可解释性技术有显著提升。这些结果表明,所提出的方法有望提高基于 LLM 的情感分析在关键应用中的可靠性与透明度。
引用
@article{arxiv.2503.11948,
title = {Integration of Explainable AI Techniques with Large Language Models for Enhanced Interpretability for Sentiment Analysis},
author = {Thivya Thogesan and Anupiya Nugaliyadde and Kok Wai Wong},
journal= {arXiv preprint arXiv:2503.11948},
year = {2025}
}