中文

基于专家偏好的自动相关工作生成评估

计算与语言 2026-01-12 v2

摘要

专家领域写作,如科学写作,通常需要广泛的领域知识。尽管大语言模型(LLMs)在此任务中显示出巨大潜力,但评估自动生成的科学写作质量是一个关键且未决的问题,因为它需要了解领域特定的标准以及辨别专家偏好的能力。传统的任务无关自动评估指标和主要为主流 NLP 任务设计的 LLM-as-a-judge 系统,不足以把握专家偏好和领域特定的质量标准。为弥补这一差距并支持现实的人机协作写作,我们以最具挑战性的科学任务之一——相关工作生成为例。我们提出 GREP,一个将经典相关工作评估标准与专家特定偏好相结合的多轮评估框架。我们的框架将评估分解为更小的细粒度维度。这种局部评估进一步通过对比示例进行增强,为评估维度提供详细的上下文指导。实证研究表明,与标准的 LLM 评判相比,我们的框架能够以更稳健的方式评估相关工作部分的质量,反映科学写作的自然场景,并与人类专家的评估具有强相关性。我们还观察到,最先进(SoTA)LLMs 的生成内容难以满足合适相关工作部分的验证约束。

关键词

引用

@article{arxiv.2508.07955,
  title  = {Expert Preference-based Evaluation of Automated Related Work Generation},
  author = {Furkan Şahinuç and Subhabrata Dutta and Iryna Gurevych},
  journal= {arXiv preprint arXiv:2508.07955},
  year   = {2026}
}

备注

Project page: https://ukplab.github.io/arxiv2025-expert-eval-rw/