中文

YESciEval:面向科学问答的稳健LLM评估器

计算与语言 2025-05-30 v2 人工智能

摘要

大型语言模型(LLMs)驱动着现代搜索引擎中的科学问答,但其评估鲁棒性仍未得到充分探索。我们提出了YESciEval,一个开源框架,结合细粒度评估准则与强化学习,以缓解LLM评估器中的乐观偏见。我们发布了多学科scienceQ&A数据集,包括对抗性变体,并提供来自多个LLM的评估分数。该方法独立于专有模型和人类反馈,实现了可扩展、无成本的评估。通过推进可靠的LLM评估器模型,本工作支持AI对齐,促进对科学探究至关重要的稳健、透明的评估。

关键词

引用

@article{arxiv.2505.14279,
  title  = {YESciEval: Robust LLM-as-a-Judge for Scientific Question Answering},
  author = {Jennifer D'Souza and Hamed Babaei Giglou and Quentin Münch},
  journal= {arXiv preprint arXiv:2505.14279},
  year   = {2025}
}

备注

9 pages, 4 figures, Accepted as a Long Paper at the 63rd Annual Meeting of the Association for Computational Linguistics (ACL 2025)