OpenReviewer:用于生成批判性学术论文评审的专用大语言模型
人工智能
2025-03-19 v3
摘要
我们提出了 OpenReviewer,一个用于生成机器学习与 AI 会议论文高质量同行评审的开源系统。其核心是 Llama-OpenReviewer-8B,一个在来自顶级会议的 79,000 份专家评审上专门微调的 80 亿参数语言模型。给定 PDF 论文投稿和评审模板作为输入,OpenReviewer 会提取包含公式和表格等技术内容的全文,并按照会议特定指南生成结构化评审。我们在 400 篇测试论文上的评估表明,与 GPT-4 和 Claude-3.5 等通用 LLM 相比,OpenReviewer 生成的评审更具批判性和真实性。其他 LLM 倾向于给出过于积极的评价,而 OpenReviewer 的推荐与人类评审者的评分分布高度一致。该系统为作者在投稿前提供了快速、建设性的反馈以改进其稿件,尽管其并非旨在取代人类同行评审。OpenReviewer 已作为在线演示和开源工具提供。
引用
@article{arxiv.2412.11948,
title = {OpenReviewer: A Specialized Large Language Model for Generating Critical Scientific Paper Reviews},
author = {Maximilian Idahl and Zahra Ahmadi},
journal= {arXiv preprint arXiv:2412.11948},
year = {2025}
}
备注
NAACL 2025 System Demonstrations Track (Camera-ready version) Demo: https://huggingface.co/spaces/maxidl/openreviewer Model: https://huggingface.co/maxidl/Llama-OpenReviewer-8B