大型语言模型用于恶意重用开源科学工具
计算与语言
2026-01-28 v1
摘要
大型语言模型(LLM)的快速发展推动了对其在科学发现中作用的热情,涌现出探索LLM如何自主生成和评估新颖研究想法的研究。然而,人们很少关注此类模型是否可能被滥用,通过重用开源科学工具来生成有害研究。我们通过引入一个端到端管道来弥补这一空白:该管道首先通过基于说服的越狱掠过LLM的安全措施,然后重新诠释NLP论文以识别并滥用其工具(数据集、方法和工具),最后通过我们的评估框架在三个维度上评估这些提议的安全性:危害性、滥用可行性以及技术性严谨性。总体而言,我们的发现表明,LLM可以通过重用旨quistically设计的开源工具来生成有害提议;然而,我们发现充当评估者的LLM在评估结果上强烈意见不合:GPT-4.1给出更高的分数(表明更大的潜在危害、更高的技术性和滥用可行性),Gemini-2.5-pro明显更严格,Grok-3则居中。这表明LLM在恶意评估情境下尚不能作为可靠的评判者,对于可信的双用途风险评估,人类评估仍是必需的。
引用
@article{arxiv.2601.18998,
title = {Malicious Repurposing of Open Science Artefacts by Using Large Language Models},
author = {Zahra Hashemi and Zhiqiang Zhong and Jun Pang and Wei Zhao},
journal= {arXiv preprint arXiv:2601.18998},
year = {2026}
}