CLINB:气候智能基准测试集
人工智能
2025-11-18 v1 计算与语言
摘要
评估大型语言模型(LLM)处理复杂、专业知识的能力 remains 一个关键挑战。我们通过气候变化的视角引入 CLINB,一个评估模型在开放式、具象化、多模态问答任务上的表现的基准测试,要求模型在知识质量和证据支持方面表现明确。CLINB 依赖于来自真实用户提问的数据集,由领先气候科学家策划的评估准则所支持。我们实现并验证了基于模型的评估过程,对多个前沿模型进行了评估。我们的发现揭示了一个关键二分法:前沿模型展现出惊人的知识综合能力,常常展现出相当于博士水平的理解和呈现质量。它们超越了由领域专家辅助较弱模型生成的“混合”答案。然而,这种表现也伴随着 grounding 失败的风险。证据质量参差不齐,引用和图像的幻觉率显著。我们认为,在 AI 应用于科学工作流程方面,桥接知识综合与可验证归因之间的差距,对于构建可信赖的 AI 系统至关重要,而可靠、可解释的基准测试如 CLINB 是实现这一目标所必需的。
引用
@article{arxiv.2511.11597,
title = {CLINB: A Climate Intelligence Benchmark for Foundational Models},
author = {Michelle Chen Huebscher and Katharine Mach and Aleksandar Stanić and Markus Leippold and Ben Gaiarin and Zeke Hausfather and Elisa Rawat and Erich Fischer and Massimiliano Ciaramita and Joeri Rogelj and Christian Buck and Lierni Sestorain Saralegui and Reto Knutti},
journal= {arXiv preprint arXiv:2511.11597},
year = {2025}
}
备注
Questions, system prompt and model judge prompts available here: https://www.kaggle.com/datasets/deepmind/clinb-questions