HypoBench:面向假设生成的系统性和原则性基准
人工智能
2026-02-12 v2 计算与语言
计算机与社会
机器学习
摘要
存在日益关注的大语言模型(LLM)的假设生成,但仍有根本性问题待解:什么才是好的假设,以及如何系统评估假设生成方法?为此,我们引入 HypoBench,一个新颖的数据集,旨在评估 LLM 和假设生成方法在多个方面,包括实用性、可推广性及假设发现率。HypoBench 包含 7 个真实任务和 5 个合成任务,共计 194 个独立数据集。我们评估了四个最先进的 LLM 结合六种现有假设生成方法。总体而言,我们的结果表明现有方法能够发现数据中的有效且新颖模式。然而,合成数据集的结果表明,仍有显著提升空间,因为当前假设生成方法未能完全发现所有相关或有意义的模式。具体而言,在合成环境中,随着任务难度增加,性能显著下降,最佳模型与方法仅恢复 的ground-truth hypotheses。这凸显了假设生成中的挑战,证明了 HypoBench 为改进旨在帮助科学发现的 AI 系统提供了宝贵资源。
引用
@article{arxiv.2504.11524,
title = {HypoBench: Towards Systematic and Principled Benchmarking for Hypothesis Generation},
author = {Haokun Liu and Sicong Huang and Jingyu Hu and Yangqiaoyu Zhou and Chenhao Tan},
journal= {arXiv preprint arXiv:2504.11524},
year = {2026}
}
备注
32 pages, 6 figures, website link: https://chicagohai.github.io/HypoBench/