中文

逆势翻盘:通过口头化拒绝采样减少 LLM 抛硬币偏差

机器学习 2026-04-24 v2 计算与语言

摘要

大语言模型(LLM)通常能够使用自然语言准确描述概率分布,但它们仍然难以从中生成忠实的样本。这种不匹配限制了它们在需要可靠随机性的任务中的应用,如蒙特卡洛方法、基于智能体的模拟和随机决策。我们在伯努利分布的背景下研究了这种知识与采样之间的差距。我们提出了口头化拒绝采样(Verbalized Rejection Sampling, VRS),一种经典拒绝采样的自然语言适配方法,它提示 LLM 对提出的样本进行推理并决定是否接受或拒绝。尽管内部依赖相同的伯努利机制,VRS 显著降低了各模型中的采样偏差。我们提供了理论分析,表明在温和假设下,VRS 优于直接采样,其增益可归因于算法和提示设计两者。更广泛地说,我们的结果表明经典概率工具如何可以被口头化并嵌入到 LLM 工作流程中以提高可靠性,而无需访问模型内部或进行大量提示工程。

关键词

引用

@article{arxiv.2506.09998,
  title  = {Flipping Against All Odds: Reducing LLM Coin Flip Bias via Verbalized Rejection Sampling},
  author = {Tim Z. Xiao and Johannes Zenn and Zhen Liu and Weiyang Liu and Robert Bamler and Bernhard Schölkopf},
  journal= {arXiv preprint arXiv:2506.09998},
  year   = {2026}
}

备注

Technical Report v2 (27 pages, 14 figures)