中文

ReviewEval:AI生成评论的评估框架

计算与语言 2025-05-27 v3 人工智能

摘要

学术研究的 volume不断增加,而合格评审人严格不足,这迫使需要创新方法来进行同行评审。本文提出:1. ReviewEval——用于AI生成评论的全面评估框架,衡量其与人类评估的一致性,验证事实准确性,评估分析深度,识别建设性程度以及是否遵循评审指南;2. ReviewAgent——一种基于大型语言模型的评论生成代理,具有新颖的对齐机制,可针对目标会议和期刊调整反馈,并包含一个自我完善循环以迭代优化其中间输出,以及使用ReviewEval进行外部改进的循环,以提高最终评论的质量。ReviewAgent在可操作性见解方面比现有AI基准和专家评论提高了6.78%和47.62%,在分析深度方面提升了3.97%和12.73%,在遵循指南方面提升了10.11%和47.26%。本文为AI-based同行评审建立了必要的指标,大幅提升了AI生成评论在学术研究中的可靠性和影响力。

关键词

引用

@article{arxiv.2502.11736,
  title  = {ReviewEval: An Evaluation Framework for AI-Generated Reviews},
  author = {Madhav Krishan Garg and Tejash Prasad and Tanmay Singhal and Chhavi Kirtani and Murari Mandal and Dhruv Kumar},
  journal= {arXiv preprint arXiv:2502.11736},
  year   = {2025}
}

备注

Under review: 8 pages, 2 figures, 5 tables, 9 pages for appendix