大型语言模型中创意任务的模型内变异性与提示间变异性
人工智能
2026-01-30 v1
摘要
我们通过在10个创意提示上对12个大型语言模型(LLM)进行评估(每组100个样本,总计12,000个样本),回答了LLM输出方差中有多少是由提示决定的、由模型选择决定的,还是由采样随机性决定的。对于输出质量(原创性),提示解释了方差的36.43%,与模型选择(40.94%)相当。但对于输出数量(流畅度),模型选择(51.25%)和模型内部变异性(33.70%)占主导,提示仅解释了4.22%。提示是控制输出质量的强大杠杆,但鉴于模型内部变异性(10-34%)仍然显著,单次样本评估风险会将抽样噪声混淆为真正的提示或模型效应。
引用
@article{arxiv.2601.21339,
title = {Within-Model vs Between-Prompt Variability in Large Language Models for Creative Tasks},
author = {Jennifer Haase and Jana Gonnermann-Müller and Paul H. P. Hanel and Nicolas Leins and Thomas Kosch and Jan Mendling and Sebastian Pokutta},
journal= {arXiv preprint arXiv:2601.21339},
year = {2026}
}