BSBench:你的LLM能找到最大的质数吗?
计算与语言
2025-06-06 v1
摘要
我们提出,对LLMs进行涉及无合理答案问题的基准测试并未如此愚蠢。我们还提出了一个允许此类测试的基准框架,并介绍了修改现有数据集的方法,发现现有模型在此类问题上的表现远非理想。我们的代码和数据文献已发布于https://github.com/L3G5/impossible-bench
引用
@article{arxiv.2506.04535,
title = {BSBench: will your LLM find the largest prime number?},
author = {K. O. T. Erziev},
journal= {arXiv preprint arXiv:2506.04535},
year = {2025}
}
备注
7 + 2 pages