面向安全关键场景的鲁棒且具代表性的 LLM 生成的主动学习
计算与语言
2024-10-16 v1
摘要
确保在广泛的场景中拥有稳健的安全措施对于面向用户的系统至关重要。虽然大型语言模型(LLM)可以为安全措施生成有价值的数据,但它们常常表现出分布偏差,聚焦于常见场景而忽略稀疏但关键的案例。这会削弱使用此类数据开发的安全协议的效果。为此,我们提出一种新框架,将主动学习与聚类集成,以引导 LLM 生成,增强其在安全场景中的代表性和鲁棒性。我们通过 LLM 生成和主动学习模型反馈的迭代过程,构建了 5.4K 个潜在安全违规的 dataset。我们的结果表明,所提框架 produces a more representative 的安全情景集合,而无需提前了解底层数据分布。此外,通过我们的方法获取的数据提高了主动学习模型以及活跃学习过程之外的模型的准确率和 F1 分数,凸显了其广泛适用性。
引用
@article{arxiv.2410.11114,
title = {Active Learning for Robust and Representative LLM Generation in Safety-Critical Scenarios},
author = {Sabit Hassan and Anthony Sicilia and Malihe Alikhani},
journal= {arXiv preprint arXiv:2410.11114},
year = {2024}
}