重新思考科学摘要评估:基于面向切面基准的可解释指标
计算与语言
2025-05-05 v2
摘要
大型预训练语言模型(LLM)的摘要能力在通用领域得到了广泛验证,但在涉及复杂句子和专业知识的科学语料库中,其应用评估相对不足。本文对科学摘要提出概念性和实验性分析,突显了传统评估方法(如n-gram、嵌入比较和问答)在提供解释、把握科学概念或识别关键内容方面的不足。随后,我们引入面向切面的指标(FM),采用LLM进行高级语义匹配,以不同方面评估摘要。这种切面化方法通过将评估任务分解为更简单的子任务,为摘要提供了全面的评估。鉴于该领域缺乏评估基准,我们构建了一个带切面级注释的数据集(FD)。我们的发现表明,FM对科学摘要的评估方法更为合理。此外,微调的较小模型在科学语境下可与LLM竞争,而LLM在学习科学领域的上下文信息方面存在局限。这为LLM的未来改进指明了方向。
引用
@article{arxiv.2402.14359,
title = {Rethinking Scientific Summarization Evaluation: Grounding Explainable Metrics on Facet-aware Benchmark},
author = {Xiuying Chen and Tairan Wang and Qingqing Zhu and Taicheng Guo and Shen Gao and Zhiyong Lu and Xin Gao and Xiangliang Zhang},
journal= {arXiv preprint arXiv:2402.14359},
year = {2025}
}
备注
14pages