大语言模型有时会生成纯负强化文本
机器学习
2023-06-19 v2 计算与语言
摘要
在使用对抗训练时,针对最恶劣的错误进行训练是常见做法。然而,这可能意味着使用包含敏感信息(如泄露的密码或安全漏洞)的示例作为训练数据。人们可能假设,通过梯度下降训练的语言模型永远不会生成仅出现在与最低可能奖励相关联的示例中的文本片段。在本文中,我们表明这一假设是错误的:在某些情况下,大语言模型确实从此类负强化示例中学习。我们提出了一种特定的训练设置,使 Pythia-160M 猜测密码的频率比随机猜测高出 13%,尽管仅在模型被激励不去输出这些密码的示例中向其展示了这些密码。我们的代码可在 www.github.com/FabienRoger/Learning-From-Negative-Examples 获取。
引用
@article{arxiv.2306.07567,
title = {Large Language Models Sometimes Generate Purely Negatively-Reinforced Text},
author = {Fabien Roger},
journal= {arXiv preprint arXiv:2306.07567},
year = {2023}
}
备注
6 pages, 5 figures, LaTeX; added a related work section