中文

大语言模型难以按所需概率分布生成输出

机器学习 2025-11-19 v1 人工智能

摘要

科学思想的生成与选择需要遵循目标概率分布进行探索。相比之下,当前 AI 基准测试答案客观正确,基于这些基准测试通过强化学习训练大语言模型(LLM)会阻碍概率探索。我们开展了系统性实验,要求 LLM 按简单概率分布生成输出,结果发现所有测试中的现代 LLM 均严重未能遵循该分布。例如,要求二元输出以 49% 的概率生成“1”,却得不到“0” 100% 的答案。这种近似排他性地生成 marginally 最高概率输出的阶梯状行为,甚至会压倒强内置的 LLM 偏见。

关键词

引用

@article{arxiv.2511.14630,
  title  = {Failure to Mix: Large language models struggle to answer according to desired probability distributions},
  author = {Ivy Yuqian Yang and David Yu Zhang},
  journal= {arXiv preprint arXiv:2511.14630},
  year   = {2025}
}

备注

13 pages, 6 figures. Code and reproducibility package: https://github.com/BiostateAIresearch/failure-to-mix