中文

基于概率建模的 LLM 级联合理性调谐

机器学习 2025-06-10 v4 人工智能 机器学习

摘要

了解大型语言模型 (LLM) 的可靠性最近引起了广泛关注。鉴于 LLM 容易产生幻觉以及其对提示设计高度敏感,预测单个 LLM 的性能已经颇具挑战。然而,对于复合型 LLM 系统(如级联),问题更为复杂,不仅要理解每个模型的独立性能,还要理解不同模型的错误率如何相互作用。本文提出了一种用于 LLM 序列的联合性能分布的概率模型,为使用连续优化对 LLM 级联的置信阈值进行理性调谐提供了框架。与使用贝叶斯优化选择置信阈值相比,我们的参数化马尔可夫 copula 模型在错误成本权衡方面更具优势,平均提高 k3k\geq 3 个模型的错误成本曲线下面积 4.3%。在样本较少的情形下(n30n \leq 30 个训练样本),性能提升幅度更大,达到 10.2%,这表明我们框架对不同 LLM 错误率相互作用的归纳假设有助于提高样本效率。总体而言,我们的马尔可夫 copula 模型为 LLM 级联性能的理性调谐提供了依据,并指向概率方法在分析 LLM 系统方面的潜力。

关键词

引用

@article{arxiv.2501.09345,
  title  = {Rational Tuning of LLM Cascades via Probabilistic Modeling},
  author = {Michael J. Zellinger and Matt Thomson},
  journal= {arXiv preprint arXiv:2501.09345},
  year   = {2025}
}

备注

20 pages, 9 figures