编码器 LLM 主干结构的靶向可视化
机器学习
2024-03-29 v1 人工智能
计算与语言
摘要
基于注意力的大语言模型 (LLM) 是自然语言处理 (NLP) 领域的最先进技术。最常见的两种架构是诸如 BERT 的编码器和诸如 GPT 模型的解码器。尽管我们在本工作中重点关注的编码器模型取得了成功,但它们也带有若干风险,包括偏见问题或其对对抗攻击的易感性,这表明需要可解释 AI 来检测此类问题。虽然确实存在各种专注于单个输入预测的局部可解释性方法,但在其他领域出现的基于降维的全局分类检查方法(其远不止是在嵌入空间中使用 t-SNE)在 NLP 领域并不普及。为了缩小这一差距,我们研究了 DeepView(一种将部分决策函数与数据集一起在二维中进行可视化的方法)在 NLP 领域的应用。虽然在以前的工作中 DeepView 被用于检查深度图像分类模型,但我们展示了如何将其应用于基于 BERT 的 NLP 分类器,并研究了其在该领域的可用性,包括具有对抗扰动输入样本以及预训练、微调和多任务模型的设置。
引用
@article{arxiv.2403.18872,
title = {Targeted Visualization of the Backbone of Encoder LLMs},
author = {Isaac Roberts and Alexander Schulz and Luca Hermes and Barbara Hammer},
journal= {arXiv preprint arXiv:2403.18872},
year = {2024}
}