中文

超越单一输出:语言模型生成分布的可视化与比较

人工智能 2026-04-24 v2

摘要

用户通常通过单一输出与语言模型交互和评估,但每个输出只是大量可能完成之一的抽样。这种交互隐藏了诸如模式、不寻常边缘情况以及对小幅 prompt 变更的敏感性等分布结构,导致用户在针对开放式任务迭代 prompt 时从轶事故事中过度概括。基于针对使用大型语言模型 (LM) 的研究人员进行的形式化研究 (n=13),探讨了随机性在实际中的重要性、他们如何推理语言分布以及当前工作流程中的薄弱环节,我们介绍了 GROVE。GROVE 是一种交互式可视化工具,将多个 LM 生成表示为通过文本图的重叠路径,揭示共享结构、分支点和聚类,同时保留对原始输出的访问权限。我们在三个众所调查的用户研究中进行评估(分别为 N=47、44 和 40 名参与者),针对互补的分布任务进行评估。我们的结果支持混合工作流程:图表概览在评估多样性等结构性判断方面更有优势,而直接输出检查在细节导向问题方面更有优势。

关键词

引用

@article{arxiv.2604.18724,
  title  = {Beyond One Output: Visualizing and Comparing Distributions of Language Model Generations},
  author = {Emily Reif and Claire Yang and Jared Hwang and Deniz Nazar and Noah A. Smith and Jeff Heer},
  journal= {arXiv preprint arXiv:2604.18724},
  year   = {2026}
}