中文

语言模型的对抗式微调:面向问题内容生成与检测的迭代优化方法

计算与语言 2023-08-29 v1 机器学习

摘要

在本文中,我们利用一种采用对抗式微调的新颖双阶段优化技术,应对大语言模型(LLMs)中意外有害内容生成这一新兴挑战。我们的双管齐下方法采用一个经微调以生成潜在有害提示的对抗模型,以及一个迭代优化以辨识这些提示的评判模型。在此对抗循环中,两个模型力求在提示阶段超越彼此,生成丰富的示例数据集,随后用于微调。这种提示与微调的迭代应用实现了持续精炼与性能提升。我们方法的表现通过在一个由 GPT-4 未能检测出的问题提示以及若干有争议但无问题的提示组成的数据集上的分类准确率进行评估。我们展示了评判模型在这一困难数据集上的分类准确率随优化过程显著提升。此外,我们表明一个基础模型 \texttt{ada} 仅经过几轮该过程后,在留出测试集上的准确率可比 GPT-4 高 13%,且此微调并行改善了如有毒评论识别等任务中的表现。

关键词

引用

@article{arxiv.2308.13768,
  title  = {Adversarial Fine-Tuning of Language Models: An Iterative Optimisation Approach for the Generation and Detection of Problematic Content},
  author = {Charles O'Neill and Jack Miller and Ioana Ciuca and Yuan-Sen Ting and Thang Bui},
  journal= {arXiv preprint arXiv:2308.13768},
  year   = {2023}
}