中文

通过数据增强的参数高效微调提升安全分类器的少样本泛化能力

机器学习 2023-10-27 v1

摘要

随着大语言模型(LLMs)被广泛采用,新的安全问题和策略不断涌现,现有安全分类器对其泛化能力不佳。如果我们仅观察到某条新安全规则违规的少数几个示例,如何构建一个检测违规的分类器?在本文中,我们研究了基于 LLM 的文本安全分类器的域泛化少样本学习这一新颖设定。与先前的少样本工作不同,这些新安全问题可能难以发现,且我们无法选择那少数几个示例。我们证明现有的少样本技术在此设定下表现不佳,转而提出进行参数高效微调(PEFT),并结合基于先前现有规则中相似示例来增强训练数据。我们通过实验表明,我们基于相似性的数据增强 + 提示微调(DAPT)方法在 Social Chemistry 道德判断任务中持续以 7-17% 的 F1 分数、在 Toxicity 检测任务中以 9-13% 的 AUC 优于不依赖数据增强或不依赖 PEFT 的基线,即使新规则与现有规则相关性较弱时也是如此。

关键词

引用

@article{arxiv.2310.16959,
  title  = {Improving Few-shot Generalization of Safety Classifiers via Data Augmented Parameter-Efficient Fine-Tuning},
  author = {Ananth Balashankar and Xiao Ma and Aradhana Sinha and Ahmad Beirami and Yao Qin and Jilin Chen and Alex Beutel},
  journal= {arXiv preprint arXiv:2310.16959},
  year   = {2023}
}