通过查询高效采样攻击评估大型语言模型的生物医学知识鲁棒性
计算与语言
2024-12-02 v3 密码学与安全
应用统计
摘要
大型语言模型(LLMs)中参数化领域知识深度的不断增加,正推动其在实际应用中的快速部署。理解模型在高风险和知识密集型任务中的脆弱性,对于量化模型预测的可信度及规范其使用至关重要。近期在自然语言处理任务中发现的作为对抗样本的命名实体(即对抗性实体),引发了关于它们对预训练和微调 LLMs 在高风险和专业领域知识鲁棒性潜在影响的疑问。我们考察了使用类型一致的实体替换作为模板,为具有生物医学知识的十亿参数级 LLMs 收集对抗性实体。为此,我们开发了一种基于幂次缩放距离加权采样的嵌入空间攻击,以在低查询预算和可控覆盖率下评估其生物医学知识的鲁棒性。我们的方法在查询效率和扩展性上优于基于随机采样和黑盒梯度引导搜索的替代方法,我们在生物医学问答的对抗性干扰项生成中对此进行了证明。随后的失效模式分析揭示了攻击面上具有不同特征的两类对抗性实体,并且我们表明实体替换攻击可以操纵逐 token 的 Shapley 值解释,使其在此设定下具有欺骗性。我们的方法补充了对高容量模型的标准评估,且结果突显了 LLMs 中领域知识的脆弱性。
引用
@article{arxiv.2402.10527,
title = {Assessing biomedical knowledge robustness in large language models by query-efficient sampling attacks},
author = {R. Patrick Xian and Alex J. Lee and Satvik Lolla and Vincent Wang and Qiming Cui and Russell Ro and Reza Abbasi-Asl},
journal= {arXiv preprint arXiv:2402.10527},
year = {2024}
}
备注
31 pages incl. appendix, accepted by TMLR