中文

结合上下文扰动表征科学问答中 LLM 的弃答行为

计算与语言 2024-10-08 v2

摘要

面对不确定性时,正确的模型响应是放弃回答问题,以免误导用户。在本工作中,我们研究了当提供不充分或错误的上下文时,LLM 放弃回答依赖上下文的科学问题的能力。我们在几种设置下探究了模型的敏感性:移除黄金上下文、将黄金上下文替换为无关上下文,以及提供超出给定内容的额外上下文。在四个 QA 数据集和六个 LLM 上的实验表明,不同模型、提供的上下文类型以及问题类型之间的性能差异很大;特别是,许多 LLM 似乎无法在使用标准 QA 提示时放弃回答布尔问题。我们的分析还强调了弃答性能对 QA 任务准确性的意外影响。与直觉相反,在某些设置下,将黄金上下文替换为无关上下文或将无关上下文添加到黄金上下文中,可以改善弃答性能,从而提升任务表现。我们的结果表明,QA 数据集的设计和评估需要做出改变,以更有效地评估模型弃答的正确性及其下游影响。

关键词

引用

@article{arxiv.2404.12452,
  title  = {Characterizing LLM Abstention Behavior in Science QA with Context Perturbations},
  author = {Bingbing Wen and Bill Howe and Lucy Lu Wang},
  journal= {arXiv preprint arXiv:2404.12452},
  year   = {2024}
}

备注

EMNLP 2024 Findings