中文

利用线性方向检测大型语言模型中的(不可)回答性

计算与语言 2025-09-29 v1

摘要

大型语言模型(LLM)在缺乏必要信息时仍常以自信口吻回答问题,导致产生幻觉答案。本文研究(不可)回答性检测问题,聚焦于抽取式问答(QA),其中模型应判断给定段落是否包含足够信息以回答特定问题。我们提出一种简单方法,在模型激活空间中识别一个能刻画不可回答性的方向,并利用其进行分类。该方向通过在推理过程中施加激活添加并测量其对模型弃权行为的影响来选定。我们证明,将隐藏激活投影至该方向可产生可靠的(不可)回答性分类分数。在两个开放权重 LLM 和四个抽取式 QA 基准上的实验表明,该方法能有效检测不可回答问题,且跨数据集的泛化能力优于现有基于提示和基于分类器的方法。此外,所得方向不仅适用于抽取式 QA,还可推广至由缺乏科学共识和主观性等因素导致的不可回答性。最后,因果干预实验表明,添加或消融该方向能有效控制模型的弃权行为。

关键词

引用

@article{arxiv.2509.22449,
  title  = {Detecting (Un)answerability in Large Language Models with Linear Directions},
  author = {Maor Juliet Lavi and Tova Milo and Mor Geva},
  journal= {arXiv preprint arXiv:2509.22449},
  year   = {2025}
}