GroundCocoa:用于评估语言模型中组合推理与条件推理的基准
计算与语言
2025-02-17 v2
摘要
大型语言模型(LLMs)的快速进步使其在标准基准测试中表现出色,甚至超过人类水平。这使得许多下游应用(如LLM代理)能够依赖其推理能力来解决复杂任务要求。然而,LLMs在简单任务中常常出乎意料地表现不佳,尤其是在看似 straightforward 的情境下——这凸显了需要更好更多样化的评估 setup 来衡量其真实能力的必要性。为此,我们选择研究组合推理和条件推理,这两种是人类认知的核心方面,并提出GroundCocoa——一个多样性 lexically 的基准,将这些推理技能与实际的航班预订问题联系起来。我们的任务涉及将详细的用户偏好与以多选格式呈现的可用航班选项进行匹配。结果表明,当前最先进的LLMs在性能上存在显著差异,尽管经过了高级的提示技术,GPT-4 Turbo这一表现最佳的模型也仅达到67%的准确率。
引用
@article{arxiv.2404.04237,
title = {GroundCocoa: A Benchmark for Evaluating Compositional & Conditional Reasoning in Language Models},
author = {Harsh Kohli and Sachin Kumar and Huan Sun},
journal= {arXiv preprint arXiv:2404.04237},
year = {2025}
}
备注
16 pages, 17 figures, 3 tables. Accepted to NAACL 2025 (Main)