文献综述组成部分的建模与分类
计算与语言
2026-02-11 v2 人工智能
人机交互
信息检索
摘要
先前的工作表明,用于分析科学文献的 AI 方法受益于根据论文句子的修辞角色(如研究空白、结果、局限性、现有方法的扩展等)对其进行标注。这种表示也有潜力支持开发能够生成高质量文献综述的新一代系统。然而,要实现这一目标,需要定义相关的标注模式以及针对文献的大规模标注有效策略。本文从两个方面应对这些挑战:1)引入了一种新颖且无歧义的标注模式,明确设计用于可靠的自动处理;2)针对根据该模式对修辞角色进行分类的任务,对广泛的大语言模型(LLM)进行了全面评估。为此,我们还提出了 Sci-Sentence,一个新颖的多学科基准,包含 700 个由领域专家手动标注的句子和 2,240 个使用 LLM 自动标注的句子。我们在此基准上评估了 37 个 LLM,涵盖不同的模型家族和规模,并使用了零样本学习和微调两种方法。实验表明,当在高质量数据上进行微调时,现代 LLM 在此任务上取得了优异的结果,F1 超过 96%,GPT-4o 等大型专有模型和轻量级开源模型均表现良好。此外,使用半合成的 LLM 生成示例扩充训练集进一步提升了性能,使小型编码器能够取得稳健的结果,并显著改进了多个开放解码器模型。
引用
@article{arxiv.2508.04337,
title = {Modelling and Classifying the Components of a Literature Review},
author = {Francisco Bolaños and Angelo Salatino and Francesco Osborne and Enrico Motta},
journal= {arXiv preprint arXiv:2508.04337},
year = {2026}
}