中文

大语言模型在双用途、体外生物学任务中的初学者提升

人工智能 2026-03-17 v2 计算与语言 密码学与安全 计算机与社会 人机交互

摘要

大语言模型(LLMs)在生物学基准测试中表现日益出色,但是否提升了初学者的能力——即,是否使人类能够比仅使用互联网资源时表现更好——仍不清楚。这一不确定性对于理解科学加速以及双用途风险至关重要。我们进行了一项多模型、多基准的人类提升研究,比较了拥有大语言模型访问权限的初学者与仅限互联网访问的控制组,在八个与生物安全相关的任务集合上进行测试。参与者在最复杂的任务中拥有充足的时间(最长可达13小时)。我们发现,拥有大语言模型的访问显著提升了表现:拥有大语言模型的初学者比对照组准确率高出4.16倍(95%置信区间[2.63, 6.87])。在四个具有专家基线(仅限互联网)的基准测试中,拥有大语言模型的初学者在三个方面超越了专家。或许令人惊讶的是,独立使用的大语言模型往往超过了由大语言模型辅助的初学者,这表明用户并未充分发挥大语言模型所能提供的最佳贡献。大多数参与者(89.6%)表示,即使在安全措施存在的情况下,也不难获取与双用途相关的information。总体而言,大语言模型在此前专为受训专业人员保留的生物学任务上显著提升了初学者的能力,凸显了需要在传统基准测试之外持续进行交互式提升评估的必要性。

关键词

引用

@article{arxiv.2602.23329,
  title  = {LLM Novice Uplift on Dual-Use, In Silico Biology Tasks},
  author = {Chen Bo Calvin Zhang and Christina Q. Knight and Nicholas Kruus and Jason Hausenloy and Pedro Medeiros and Nathaniel Li and Aiden Kim and Yury Orlovskiy and Coleman Breen and Bryce Cai and Jasper Götting and Andrew Bo Liu and Samira Nedungadi and Paula Rodriguez and Yannis Yiming He and Mohamed Shaaban and Zifan Wang and Seth Donoughe and Julian Michael},
  journal= {arXiv preprint arXiv:2602.23329},
  year   = {2026}
}

备注

59 pages, 33 figures