中文

重新思考科学摘要评估:基于面向切面基准的可解释指标

计算与语言 2025-05-05 v2

摘要

大型预训练语言模型(LLM)的摘要能力在通用领域得到了广泛验证,但在涉及复杂句子和专业知识的科学语料库中,其应用评估相对不足。本文对科学摘要提出概念性和实验性分析,突显了传统评估方法(如n-gram、嵌入比较和问答)在提供解释、把握科学概念或识别关键内容方面的不足。随后,我们引入面向切面的指标(FM),采用LLM进行高级语义匹配,以不同方面评估摘要。这种切面化方法通过将评估任务分解为更简单的子任务,为摘要提供了全面的评估。鉴于该领域缺乏评估基准,我们构建了一个带切面级注释的数据集(FD)。我们的发现表明,FM对科学摘要的评估方法更为合理。此外,微调的较小模型在科学语境下可与LLM竞争,而LLM在学习科学领域的上下文信息方面存在局限。这为LLM的未来改进指明了方向。

关键词

引用

@article{arxiv.2402.14359,
  title  = {Rethinking Scientific Summarization Evaluation: Grounding Explainable Metrics on Facet-aware Benchmark},
  author = {Xiuying Chen and Tairan Wang and Qingqing Zhu and Taicheng Guo and Shen Gao and Zhiyong Lu and Xin Gao and Xiangliang Zhang},
  journal= {arXiv preprint arXiv:2402.14359},
  year   = {2025}
}

备注

14pages