中文

HypoBench:面向假设生成的系统性和原则性基准

人工智能 2026-02-12 v2 计算与语言 计算机与社会 机器学习

摘要

存在日益关注的大语言模型(LLM)的假设生成,但仍有根本性问题待解:什么才是好的假设,以及如何系统评估假设生成方法?为此,我们引入 HypoBench,一个新颖的数据集,旨在评估 LLM 和假设生成方法在多个方面,包括实用性、可推广性及假设发现率。HypoBench 包含 7 个真实任务和 5 个合成任务,共计 194 个独立数据集。我们评估了四个最先进的 LLM 结合六种现有假设生成方法。总体而言,我们的结果表明现有方法能够发现数据中的有效且新颖模式。然而,合成数据集的结果表明,仍有显著提升空间,因为当前假设生成方法未能完全发现所有相关或有意义的模式。具体而言,在合成环境中,随着任务难度增加,性能显著下降,最佳模型与方法仅恢复 38.8%38.8\% 的ground-truth hypotheses。这凸显了假设生成中的挑战,证明了 HypoBench 为改进旨在帮助科学发现的 AI 系统提供了宝贵资源。

关键词

引用

@article{arxiv.2504.11524,
  title  = {HypoBench: Towards Systematic and Principled Benchmarking for Hypothesis Generation},
  author = {Haokun Liu and Sicong Huang and Jingyu Hu and Yangqiaoyu Zhou and Chenhao Tan},
  journal= {arXiv preprint arXiv:2504.11524},
  year   = {2026}
}

备注

32 pages, 6 figures, website link: https://chicagohai.github.io/HypoBench/