中文

多样性解释推理缩放定律:通过最小贝叶斯风险解码的案例研究

计算与语言 2025-06-10 v2

摘要

推理方法在发挥大型语言模型 (LLM) 的性能中扮演着重要角色。目前,LLM 使用利用生成多个样本的推理方法,这些方法可以源自最小贝叶斯风险 (MBR) 解码。先前的研究进行了实证分析,以阐明 MBR 解码带来的生成性能提升,并报告了各种观察结果。然而,这些发现的理论基础仍不确定。为了解决这个问题,我们从偏差-多样性分解的角度为 MBR 解码提供了一种新的理论解释。在这种解释中,MBR 解码对假设的质量估计误差被分解为两个主要因素:偏差,它考虑了效用函数与人类评估之间的接近程度;以及多样性,它代表了效用函数质量估计的变异性。理论分析揭示了同时改善偏差和多样性的困难,证实了通过增加多样性来增强 MBR 解码性能的有效性。此外,我们揭示了多样性可以解释推理缩放定律的一个方面,该定律描述了通过增加样本量来提升性能。此外,跨多个 NLP 任务的实验产生了与这些理论特性一致的结果。我们的代码可在 https://github.com/naist-nlp/mbr-bias-diversity 获取。

关键词

引用

@article{arxiv.2410.15021,
  title  = {Diversity Explains Inference Scaling Laws: Through a Case Study of Minimum Bayes Risk Decoding},
  author = {Hidetaka Kamigaito and Hiroyuki Deguchi and Yusuke Sakai and Katsuhiko Hayashi and Taro Watanabe},
  journal= {arXiv preprint arXiv:2410.15021},
  year   = {2025}
}

备注

Accepted to ACL 2025 Main