Sci2Pol:评估与微调用于科学到政策简报生成的大语言模型
计算工程、金融与科学
2026-02-20 v2
摘要
我们提出Sci2Pol-Bench和Sci2Pol-Corpus,用于评估和微调大型语言模型(LLMs)在从科学论文生成政策简报。我们构建Sci2Pol-Bench基于五阶段分类法来模拟人类写作过程:(i) 自动完成,(ii) 理解,(iii) 概括,(iv) 生成,和(v) 验证。它包含18个任务,采用多选和开放式格式。具体而言,对于生成阶段,我们发现BERTScore和ROUGE得分未能捕捉简报写作质量,提出了一种新的基于LLM的评估指标,与专家判断相一致。使用该基准,我们评估了13个领先的开源和商业LLMs,以发现其关键局限性。为提高LLMs在简报写作方面的性能,我们精选了Sci2Pol-Corpus进行微调。我们首先将每个引用的科学论文链接到其对应的政策文件,从560万条政策记录中获得。这产生了140,000个候选对。随后,我们采用LLM作为评判家筛选高质量示例,最后通过将三个专家编写的样本作为参考进行上下文润色。这一过程产生了最终的639个新对。最后,我们在Sci2Pol-Corpus上对三个模型进行微调:LLaMA-3.18B、Gemma-12B和Gemma-27B。微调后,Gemma-27B超过了更大规模的GPT-4o和DeepSeek-V3 (671B)。这些结果表明,我们的语料库在桥接科学与政策方面具有有效性。
引用
@article{arxiv.2509.21493,
title = {Sci2Pol: Evaluating and Fine-tuning LLMs on Scientific-to-Policy Brief Generation},
author = {Weimin Wu and Alexander C. Furnas and Eddie Yang and Gefei Liu and Akhil Pandey Akella and Xuefeng Song and Dashun Wang and Han Liu},
journal= {arXiv preprint arXiv:2509.21493},
year = {2026}
}