我得到了“答案”!LLMs在问答中隐藏状态的解释
计算与语言
2024-06-05 v1 人工智能
摘要
随着大型语言模型(LLMs)的快速发展,AI 的可解释性和可说明性变得越来越重要。本文研究了在基于知识的问答背景下 LLMs 的解释。该研究的主要假设是,正确和错误的模型行为可以在隐藏状态层面进行区分。使用量化模型 LLaMA-2-7B-Chat、Mistral-7B、Vicuna-7B 和 MuSeRC 问答数据集来检验这一假设。分析结果支持了所提出的假设。我们还识别出对模型行为有负面影响的层。作为该假设实际应用的前景,我们建议额外训练这些“薄弱”层,以提高任务解决的质量。
引用
@article{arxiv.2406.02060,
title = {I've got the "Answer"! Interpretation of LLMs Hidden States in Question Answering},
author = {Valeriya Goloviznina and Evgeny Kotelnikov},
journal= {arXiv preprint arXiv:2406.02060},
year = {2024}
}
备注
Accepted for NLDB-2024 conference