中文

多样性度量:语言模型查询失败与领域无关的代理指标

计算与语言 2024-01-30 v1 人工智能 机器学习

摘要

大语言模型中的错误预测通常依赖于领域特定信息。在本文中,我们提出了一种基于给定提示下响应多样性来量化大语言模型响应中错误的度量方法——因而与底层应用无关。我们描述了如何运用三种此类度量——基于熵、基尼不纯度和质心距离——并进行了多数据集与多温度设定下的一系列实验,以证明这些度量与失败概率强相关。此外,我们给出了经验结果,展示了这些度量如何应用于少样本提示、思维链推理与错误检测。

关键词

引用

@article{arxiv.2308.11189,
  title  = {Diversity Measures: Domain-Independent Proxies for Failure in Language Model Queries},
  author = {Noel Ngu and Nathaniel Lee and Paulo Shakarian},
  journal= {arXiv preprint arXiv:2308.11189},
  year   = {2024}
}