HypoSpace:评估LLM在欲望不确定性下作为集合价假设生成器的创造力
计算与语言
2026-03-10 v2
摘要
随着语言模型在科学工作流程中的应用日益增多,评估其提出一组解释——而不仅仅是单个正确答案——的能力变得至关重要。许多科学问题是欲望不确定的:多个、在机制上不同的假设与相同的观察结果一致。我们引入HypoSpace,一个诊断套件,将LLM视为有限假设集合的采样器,并衡量三个互补指标:有效性(与观察结果一致的提议的精确度)、唯一性(提议之间的非冗余性)和恢复(覆盖被枚举可采纳集合的程度)。我们在三个具有确定性验证器且恰好枚举假设空间的结构化领域中实现HypoSpace:(i)来自扰动的因果图,(ii)来自顶视图的重力约束3D体素重建,(iii)布尔遗传相互作用。在指令调校和推理focused模型中,有效性通常保持较高,而唯一性和恢复随可采纳空间的增大而恶化,揭示了对正确性-only指标不可见的模式坍缩。HypoSpace提供了一个受控探针——而非排行榜——用于方法的探索和覆盖可采纳解释空间的方法。代码可在:https://github.com/CTT-Pavilion/_HypoSpace 获取。
引用
@article{arxiv.2510.15614,
title = {HypoSpace: Evaluating LLM Creativity as Set-Valued Hypothesis Generators under Underdetermination},
author = {Tingting Chen and Beibei Lin and Zifeng Yuan and Qiran Zou and Hongyu He and Anirudh Goyal and Yew-Soon Ong and Dianbo Liu},
journal= {arXiv preprint arXiv:2510.15614},
year = {2026}
}