中文

我得到了“答案”!LLMs在问答中隐藏状态的解释

计算与语言 2024-06-05 v1 人工智能

摘要

随着大型语言模型(LLMs)的快速发展,AI 的可解释性和可说明性变得越来越重要。本文研究了在基于知识的问答背景下 LLMs 的解释。该研究的主要假设是,正确和错误的模型行为可以在隐藏状态层面进行区分。使用量化模型 LLaMA-2-7B-Chat、Mistral-7B、Vicuna-7B 和 MuSeRC 问答数据集来检验这一假设。分析结果支持了所提出的假设。我们还识别出对模型行为有负面影响的层。作为该假设实际应用的前景,我们建议额外训练这些“薄弱”层,以提高任务解决的质量。

关键词

引用

@article{arxiv.2406.02060,
  title  = {I've got the "Answer"! Interpretation of LLMs Hidden States in Question Answering},
  author = {Valeriya Goloviznina and Evgeny Kotelnikov},
  journal= {arXiv preprint arXiv:2406.02060},
  year   = {2024}
}

备注

Accepted for NLDB-2024 conference