SciSafeEval:面向科学任务的大型语言模型安全对齐综合基准
计算与语言
2024-12-17 v2 人工智能
密码学与安全
摘要
大型语言模型(LLM)在生物学、化学、医学和物理学等多个学科的科学任务中发挥了变革性作用。然而,确保这些模型在科学研究中的安全对齐仍是一个未被充分探索的领域,现有基准主要关注文本内容,忽略了如分子、蛋白质和基因组语言等关键科学表征。此外,LLM 在科学任务中的安全机制也不充分。为此,我们引入 SciSafeEval,一个综合性基准,用于评估 LLM 在各种科学任务中的安全对齐。SciSafeEval 涵盖多种科学语言,包括文本、分子、蛋白质和基因组语言,并涵盖广泛的科学领域。我们在零样本、少样本和链式思考设置中评估了 LLM,并引入了一种“越狱”增强功能,挑战具备安全防御的 LLM,其防御力度以测试其对恶意意图的抵抗力。我们的基准在规模和范围上均超越了现有安全数据集,为评估 LLM 在科学语境下的安全性和性能提供了稳健平台。本工作旨在促进 LLM 的负责任开发和部署,推动其在科学研究中与安全和伦理标准保持一致。
关键词
引用
@article{arxiv.2410.03769,
title = {SciSafeEval: A Comprehensive Benchmark for Safety Alignment of Large Language Models in Scientific Tasks},
author = {Tianhao Li and Jingyu Lu and Chuangxin Chu and Tianyu Zeng and Yujia Zheng and Mei Li and Haotian Huang and Bin Wu and Zuoxian Liu and Kai Ma and Xuejing Yuan and Xingkai Wang and Keyan Ding and Huajun Chen and Qiang Zhang},
journal= {arXiv preprint arXiv:2410.03769},
year = {2024}
}