AI 可以学习科学品味
计算与语言
2026-03-17 v1
摘要
伟大的科学家拥有强大的判断力和前瞻性,这与我们所称的科学品味紧密相关。本文中,我们使用该术语指代对判断和提出高潜在影响力的研究想法具有能力的能力。然而,尽管大多数相对性研究聚焦于提高 AI 科学家的执行能力,却很少探索如何增强 AI 的科学品味。本文中,我们提出了基于社区反馈的强化学习 (RLCF) 训练范式,该范式将大规模社区信号用作监督信号,并将科学品味学习表述为偏好建模和对齐问题。对于偏好建模,我们在 70 万对高引用论文与低引用论文的字段匹配且时间匹配的配对上训练 Scientific Judge 以判断想法。对于偏好对齐,我们将 Scientific Judge 作为奖励模型,训练策略模型 Scientific Thinker 以提出高潜在影响力的研究想法。实验表明,Scientific Judge 在超越 SOTA 的大语言模型(如 GPT-5.2、Gemini 3 Pro)方面表现更佳,并能泛化到未来年份的测试、未见字段和同行评审偏好。此外,Scientific Thinker 提出的研究想法在潜在影响力方面优于基线方法。我们的发现表明,AI 可以学习科学品味,这标志着迈向人类水平 AI 科学家的关键一步。
引用
@article{arxiv.2603.14473,
title = {AI Can Learn Scientific Taste},
author = {Jingqi Tong and Mingzhe Li and Hangcheng Li and Yongzhuo Yang and Yurong Mou and Weijie Ma and Zhiheng Xi and Hongji Chen and Xiaoran Liu and Qinyuan Cheng and Ming Zhang and Qiguang Chen and Weifeng Ge and Qipeng Guo and Tianlei Ying and Tianxiang Sun and Yining Zheng and Xinchi Chen and Jun Zhao and Ning Ding and Xuanjing Huang and Yugang Jiang and Xipeng Qiu},
journal= {arXiv preprint arXiv:2603.14473},
year = {2026}
}
备注
44 pages, 4 figures