中文

利用风险调整置信分数提升大语言模型鲁棒性的形式化方法与途径

计算与语言 2023-10-06 v1

摘要

大语言模型(LLM),如 ChatGPT,已在自然语言处理(NLP)中取得令人瞩目的里程碑。尽管性能令人惊叹,这些模型已知会带来重要风险。随着这些模型部署于真实应用,亟需对它们在自然语言推理(NLI)等任务上带来的不同风险建立系统性理解。本文中,我们定义并形式化了两类不同的风险:决策风险与复合风险。我们还提出了以风险为中心的评估框架,以及四个新指标,用于在域内与域外设置下评估 LLM 的这些风险。最后,我们提出了一种称为 DwD 的风险调整校准方法,以帮助 LLM 在整体 NLI 架构中最小化这些风险。使用四个 NLI 基准、三个基线与包括 ChatGPT 在内的两个 LLM 的详细实验,展示了评估框架的实用效用,以及 DwD 在降低决策与复合风险上的功效。例如,当使用 DwD 时,底层 LLM 能够处理额外 20.1% 的低风险推理任务(但 LLM 在无风险调整时错误地视为高风险),并跳过进一步 19.8% 的高风险任务(这些任务本会被错误回答)。

关键词

引用

@article{arxiv.2310.03283,
  title  = {A Formalism and Approach for Improving Robustness of Large Language Models Using Risk-Adjusted Confidence Scores},
  author = {Ke Shen and Mayank Kejriwal},
  journal= {arXiv preprint arXiv:2310.03283},
  year   = {2023}
}