中文

评估萨卡纳的 AI 科学家:大胆的宣称、混合的结果与前景

计算机与社会 2026-05-18 v5

摘要

人工通用智能 (AGI) 和超级智能的一个重要步骤是 AI 能够自主开展研究——我们称之为人工研究智能 (ARI)。如果机器能够生成假设、开展实验并在无需人工干预的情况下撰写研究论文,这将彻底改变科学。萨卡纳最近推出了“AI 科学家”,声称能够自主开展研究,即他们暗示实现了我们所称的人工研究智能 (ARI)。AI 科学家获得了广泛关注,但尚无进行彻底的独立评估。我们对 AI 科学家的评估揭示了关键短comings。该系统的文献综述产生了较差的新颖性评估,常常将既定概念(例如随机梯度下降的微批处理)误判为新颖。它在实验执行方面也面临挑战:42% 的实验因编码错误而失败,其他实验则产生错误或误导性的结果。代码修改最小,平均每迭代增加 8% 的字符,表明其适应性有限。生成的手稿缺乏实证支持,中位引用数为五,最多只有五篇来自 2020 年或更晚的文献。结构性错误频发,包括缺失图表、重复章节和占位符文本如“Conclusions Here”。一些论文包含幻觉的数值结果。尽管存在这些缺陷,AI 科学家是研究自动化的一个跨越式的进步。它能够以最少的人工输入生成完整的研究手稿,挑战了 AI 驱动科学的期望。许多审稿人可能难以区分其工作与人类研究者的工作。虽然其质量类似于匆忙的本科生论文,但其速度和成本效益空前,在 3.5 小时的人工参与下即可为美元 6 到 15 美元产生一篇完整论文,远超传统研究者的速度。

关键词

引用

@article{arxiv.2502.14296,
  title  = {On the Trustworthiness of Generative Foundation Models: Guideline, Assessment, and Perspective},
  author = {Yue Huang and Chujie Gao and Siyuan Wu and Haoran Wang and Xiangqi Wang and Yujun Zhou and Yanbo Wang and Jiayi Ye and Jiawen Shi and Qihui Zhang and Yuan Li and Han Bao and Zhaoyi Liu and Tianrui Guan and Dongping Chen and Ruoxi Chen and Kehan Guo and Andy Zou and Bryan Hooi Kuen-Yew and Caiming Xiong and Elias Stengel-Eskin and Hongyang Zhang and Hongzhi Yin and Huan Zhang and Huaxiu Yao and Jaehong Yoon and Jieyu Zhang and Kai Shu and Kaijie Zhu and Ranjay Krishna and Swabha Swayamdipta and Taiwei Shi and Weijia Shi and Xiang Li and Yiwei Li and Yuexing Hao and Zhihao Jia and Zhize Li and Xiuying Chen and Zhengzhong Tu and Xiyang Hu and Tianyi Zhou and Jieyu Zhao and Lichao Sun and Furong Huang and Or Cohen Sasson and Prasanna Sattigeri and Anka Reuel and Max Lamparth and Yue Zhao and Nouha Dziri and Yu Su and Huan Sun and Heng Ji and Chaowei Xiao and Mohit Bansal and Nitesh V. Chawla and Jian Pei and Jianfeng Gao and Michael Backes and Philip S. Yu and Neil Zhenqiang Gong and Pin-Yu Chen and Bo Li and Dawn Song and Xiangliang Zhang},
  journal= {arXiv preprint arXiv:2502.14296},
  year   = {2026}
}