中文

NAIPv2:用于高效论文质量估计的去偏成对学习

计算与语言 2025-10-02 v2 人工智能

摘要

估计科学论文质量的能力对于人类和AI系统未来如何推进科学知识至关重要。然而,现有的基于LLM的估计方法推理成本高昂,而更快的直接分数回归方法则受限于尺度不一致性。我们提出了NAIPv2,一个用于论文质量估计的去偏且高效的框架。NAIPv2在领域-年份组内采用成对学习以减少审稿人评分的不一致性,并引入了审稿倾向信号(RTS)作为审稿人评分与置信度的概率整合。为了支持训练和评估,我们进一步构建了NAIDv2,这是一个包含24,276篇ICLR投稿的大规模数据集,并丰富了元数据和详细的结构化内容。NAIPv2基于成对比较进行训练,但在部署时能够实现高效的逐点预测,达到了最先进的性能(78.2% AUC,0.432 Spearman),同时在推理时保持可扩展的线性时间效率。值得注意的是,在未见的NeurIPS投稿上,它进一步展现出强大的泛化能力,预测分数在从Rejected到Oral的决策类别中保持一致增长。这些发现确立了NAIPv2作为一个用于自动论文质量估计的去偏且可扩展的框架,标志着迈向未来科学智能系统的一步。代码和数据集已发布于sway.cloud.microsoft/Pr42npP80MfPhvj8。

关键词

引用

@article{arxiv.2509.25179,
  title  = {NAIPv2: Debiased Pairwise Learning for Efficient Paper Quality Estimation},
  author = {Penghai Zhao and Jinyu Tian and Qinghua Xing and Xin Zhang and Zheng Li and Jianjun Qian and Ming-Ming Cheng and Xiang Li},
  journal= {arXiv preprint arXiv:2509.25179},
  year   = {2025}
}

备注

NAIPv2 complements our earlier work NAIPv1 (arXiv:2408.03934). Whereas NAIPv1 addressed citation count-based impact prediction, NAIPv2 estimates research quality using peer review data