中文

PLR:用于重新排序零样本学习示例的 Plackett-Luce 模型

机器学习 2026-04-23 v2 计算与语言

摘要

零样本学习(ICL)通过以小型 ICL 示例集条件化来适应大语言模型,避免了高昂的参数更新成本。就其他因素而言,性能往往对示例排序高度敏感。然而,穷举搜索所有 n!n! 可能的排序是不可行的。因此,更高效的排序方法使用模型置信度度量(如标签概率熵)对标签集合进行建模,或直接寻找最佳排序。我们提出 PLR,一种用于 ICL 示例排序的概率方法,将离散排序搜索替换为对排序概率分布的学习,采用 Plackett-Luce 模型。PLR 使用 Plackett-Luce 分布建模排序,并迭代更新其参数以集中概率质量于在任务级度量下表现良好的排序上。在 Gumbel 扰动排序过程中高效抽样候选排序。在多个分类基准测试上实验表明,PLR 在 k{4,8,16,32}k \in \{4, 8, 16, 32\} 示例时 consistently 提升了 few-shot 准确率,我们进一步在数学推理任务中展示了收益,在此类任务中,基于标签的排序方法不适用。我们的代码已公开于 https://github.com/Batorskq/PLR。

关键词

引用

@article{arxiv.2603.21373,
  title  = {PLR: Plackett-Luce for Reordering In-Context Learning Examples},
  author = {Pawel Batorski and Paul Swoboda},
  journal= {arXiv preprint arXiv:2603.21373},
  year   = {2026}
}