中文

ClimaQA:气候问答模型的自动评估框架

机器学习 2025-03-11 v2

摘要

大型语言模型 (LLM) 在气候科学中的应用最近受到广泛关注。然而,仍存在一个关键问题:缺乏能够评估模型输出质量和科学有效性的综合性评估框架。为此,我们开发了 ClimaGen (气候问答生成器),一个自适应学习框架,从气候科学研究生教科书中生成问答对,并邀请气候科学家参与。结果我们提出了 ClimaQA-Gold,一个由专家标注的基准数据集,以及 ClimaQA-Silver,一个大规模、全面的气候科学合成 QA 数据集。最后,我们开发了评估策略并对不同 LLM 在基准上的表现进行比较。我们的结果为增强气候 LLM 知识的 various 方法提供了新见解。源代码已公开于 https://github.com/Rose-STL-Lab/genie-climaqa

关键词

引用

@article{arxiv.2410.16701,
  title  = {ClimaQA: An Automated Evaluation Framework for Climate Question Answering Models},
  author = {Veeramakali Vignesh Manivannan and Yasaman Jafari and Srikar Eranky and Spencer Ho and Rose Yu and Duncan Watson-Parris and Yian Ma and Leon Bergen and Taylor Berg-Kirkpatrick},
  journal= {arXiv preprint arXiv:2410.16701},
  year   = {2025}
}

备注

Accepted to ICLR 2025