Bioalignment:衡量与改进 LLM 对生物系统倾向的指标用于 AI 安全
计算与语言
2026-03-11 v1
摘要
在大规模语料库上训练的大型语言模型(LLM)可能呈现系统性偏见,增加不希望发生的行为概率。在本研究中,我们检查了对合成与生物技术解决方案的偏见,涵盖四个领域(材料、能源、制造和算法)。使用 50 个精选的 Bioalignment 提示评估了 5 个前沿模型和 5 个开源模型,根据基于 Kelly 准则的评估框架。根据此指标,大多数模型在生物对齐方面不达标,因为它们倾向于合成(非生物)解决方案。我们随后检查了微调是否可以增加两个开源模型(Llama 3.2-3B-Instruct 和 Qwen2.5-3B-Instruct)对生物方法的偏好。使用来自 6,636 篇 PMC 文章的约 2200 万 token 的精选语料库,强调生物问题解决方法,首先用于混合语料库(持续训练和指令格式)微调 Llama 3B,然后扩展到仅使用指令格式的 Qwen 3B。我们发现 QLoRA 微调显著增加了两个模型对生物解决方案的评分,而不会降低通用能力(分别经过 Holm-Bonferroni 校正的 p 值 < 0.001 和 p < 0.01)。这表明,即使少量微调也能改变模型如何权衡生物/仿生与合成方法的相对价值。虽然本工作聚焦于小型开源 LLM,但可能扩展到更大规模的模型,可用于开发偏好生物方法的模型。我们发布了基准、语料库、代码和适配器权重。
引用
@article{arxiv.2603.09154,
title = {Bioalignment: Measuring and Improving LLM Disposition Toward Biological Systems for AI Safety},
author = {Trent R Northen and Mingxun Wang},
journal= {arXiv preprint arXiv:2603.09154},
year = {2026}
}
备注
17 pages, 4 figures