大语言模型难以按所需概率分布生成输出
机器学习
2025-11-19 v1 人工智能
摘要
科学思想的生成与选择需要遵循目标概率分布进行探索。相比之下,当前 AI 基准测试答案客观正确,基于这些基准测试通过强化学习训练大语言模型(LLM)会阻碍概率探索。我们开展了系统性实验,要求 LLM 按简单概率分布生成输出,结果发现所有测试中的现代 LLM 均严重未能遵循该分布。例如,要求二元输出以 49% 的概率生成“1”,却得不到“0” 100% 的答案。这种近似排他性地生成 marginally 最高概率输出的阶梯状行为,甚至会压倒强内置的 LLM 偏见。
引用
@article{arxiv.2511.14630,
title = {Failure to Mix: Large language models struggle to answer according to desired probability distributions},
author = {Ivy Yuqian Yang and David Yu Zhang},
journal= {arXiv preprint arXiv:2511.14630},
year = {2025}
}
备注
13 pages, 6 figures. Code and reproducibility package: https://github.com/BiostateAIresearch/failure-to-mix