中文

AI 驱动的评审系统:在可扩展且无偏见的学术评审中评估大语言模型

人工智能 2024-08-21 v1

摘要

自动评审有助于处理大量论文、提供早期反馈和质量控制、减少偏见,并允许分析趋势。我们通过成对比较的人类偏好竞技场来评估自动论文评审与人类评审的一致性。收集人类偏好可能耗时;因此,我们也使用大语言模型自动评估评审,以提高样本效率并减少偏见。除了评估 LLM 评审中的人类偏好和 LLM 偏好外,我们还微调了一个 LLM 来预测人类偏好,预测人类在 LLM 之间的正面交锋中会偏好哪些评审。我们人工地向论文中引入错误并分析 LLM 的响应以识别局限性,使用自适应评审问题、元提示、角色扮演、整合视觉和文本分析、使用特定会议评审材料,并预测人类偏好,以改进传统评审流程的局限性。我们将公开可用的 arXiv 和开放获取 Nature 期刊论文的评审结果在线发布,同时提供免费服务帮助作者评审和修改其研究论文并提高质量。本工作开发了概念验证的大语言模型评审系统,能够快速提供一致且高质量的评审并评估其质量。我们通过用多种文档增强 LLM(包括评审表、评审者指南、伦理和行为准则、领域主席指南以及往年统计数据),通过找出自动化评审可能检测到的论文错误和缺点,以及评估成对评审者偏好,来缓解滥用风险、虚高的评审分数、过度自信的评分和偏斜的分数分布。本工作识别并解决了将 LLM 用作评审者和评估者的局限性,并提升了评审过程的质量。

关键词

引用

@article{arxiv.2408.10365,
  title  = {AI-Driven Review Systems: Evaluating LLMs in Scalable and Bias-Aware Academic Reviews},
  author = {Keith Tyser and Ben Segev and Gaston Longhitano and Xin-Yu Zhang and Zachary Meeks and Jason Lee and Uday Garg and Nicholas Belsten and Avi Shporer and Madeleine Udell and Dov Te'eni and Iddo Drori},
  journal= {arXiv preprint arXiv:2408.10365},
  year   = {2024}
}

备注

42 pages