中文

测量2025年LLM助力对初学者在生物学中的表现

计算机与社会 2026-02-19 v1 人工智能

摘要

大型语言模型(LLMs)在生物学基准测试中表现强劲,这引发了担忧它们可能帮助初学者获取双用途实验室技能。然而,这是否转化为实体实验室中人类表现的提高尚不明确。为此,我们进行了一项预注册、调查员盲法、随机对照试验(2025年6月至8月;n=153),评估LLMs是否提高了初学者在模拟病毒逆转遗传工作流程的任务中的表现。我们观察到主要终点(工作流程完成)在LLM组(5.2%)与Internet组(6.6%)之间没有显著差异(P=0.759),也没有在各个任务的成功率之间存在差异。然而,LLM组在四个五个任务中都有数值更高的成功率,尤其是细胞培养任务(LLM 68.8% vs. Internet 55.3%;P=0.059)。后验贝叶斯建模估计了典型逆转遗传任务在LLM辅助下的成功率约为1.4倍(95% CrI 0.74-2.62)。序数回归建模表明,LLM组的参与者更可能在所有任务中逐步完成各个中间步骤(正面效应的后验概率:81%-96%)。总体而言,2025年中期的LLMs未显著提高初学者完成复杂实验室程序的能力,但与其有关的是对表现有所帮助的程度。这揭示了面向人工智能生物安全评估的实际世界实用性之间的差距,强调在模型能力和用户熟练程度不断演化的同时,需要对AI生物安全评估进行物理世界验证。

关键词

引用

@article{arxiv.2602.16703,
  title  = {Measuring Mid-2025 LLM-Assistance on Novice Performance in Biology},
  author = {Shen Zhou Hong and Alex Kleinman and Alyssa Mathiowetz and Adam Howes and Julian Cohen and Suveer Ganta and Alex Letizia and Dora Liao and Deepika Pahari and Xavier Roberts-Gaal and Luca Righetti and Joe Torres},
  journal= {arXiv preprint arXiv:2602.16703},
  year   = {2026}
}