ScholarCopilot:用于学术写作的准确引文大语言模型训练
计算与语言
2025-04-04 v2
摘要
学术写作需要连贯的文本生成和精确的相关文献引述。虽然最近的检索增强生成(RAG)系统在一般用途文本生成方面显著提高了事实准确性,但其支持专业学术写作的能力仍有限。本文介绍ScholarCopilot,一个统一的框架,旨在增强现有大型语言模型,以生成带有准确且上下文相关引述的专业学术文章。ScholarCopilot动态确定何时检索学术参考文献,通过生成检索标记[RET]来查询引用数据库。所检索的参考文献被输入模型以增强生成过程。我们在单个框架中联合优化生成和引述任务,以提高效率。该模型基于Qwen-2.5-7B训练,采用来自arXiv的50万篇论文。它在评估数据集上实现了40.1%的顶级检索准确率,显著优于E5-Mistral-7B-Instruct(15.0%)和BM25(9.8%)。在1000个学术写作样本的数据集上,ScholarCopilot在生成质量上得分16.2/25——该分数基于相关性、连贯性、学术严谨性、完整性和创新性——显著优于所有现有模型,包括更大的模型如检索增强版Qwen2.5-72B-Instruct。人类研究进一步表明,ScholarCopilot尽管是7B模型,仍显著优于ChatGPT,在引述质量上实现100%的偏好,在整体实用性上超过70%。
引用
@article{arxiv.2504.00824,
title = {ScholarCopilot: Training Large Language Models for Academic Writing with Accurate Citations},
author = {Yubo Wang and Xueguang Ma and Ping Nie and Huaye Zeng and Zhiheng Lyu and Yuxuan Zhang and Benjamin Schneider and Yi Lu and Xiang Yue and Wenhu Chen},
journal= {arXiv preprint arXiv:2504.00824},
year = {2025}
}