中文

估计语言模型中输出的稀有概率

机器学习 2025-02-07 v2 人工智能 机器学习

摘要

我们考虑低概率估计问题:给定一个机器学习模型和一个明确指定的输入分布,我们如何估计模型输出的某个二元属性的概率,即使该概率小到无法通过随机抽样来估计?这个问题源于改善最坏情况性能的需求,而分布偏移可能使这种最坏情况发生的可能性大大增加。我们在小型 transformer 语言模型的 argmax 采样背景下研究低概率估计。我们比较了两类方法:重要性采样(涉及搜索产生稀有输出的输入)和激活外推法(涉及对模型 logits 拟合的概率分布进行外推)。我们发现重要性采样优于激活外推法,但两者都优于朴素采样。最后,我们解释了如何最小化不良行为的概率估计可以推广对抗训练,并指出需要新的低概率估计方法来为最坏情况性能提供更强的保证。

关键词

引用

@article{arxiv.2410.13211,
  title  = {Estimating the Probabilities of Rare Outputs in Language Models},
  author = {Gabriel Wu and Jacob Hilton},
  journal= {arXiv preprint arXiv:2410.13211},
  year   = {2025}
}

备注

29 pages, 9 figures