面向最小化定向更新的语言模型:利用定向负面训练
计算与语言
2024-06-21 v1 人工智能
摘要
生成式语言模型展现了惊人的能力,但仍对不良输出赋予显著概率质量。在本工作中,我们解决了一个挑战性问题:如何在最小化其他模型行为变更的前提下更新模型以避免不良输出,我们将此称为最小化定向更新。我们首先形式化了最小化定向更新的概念,并提出一种方法通过模型生成的负面示例来实现此类更新。我们的所提出的定向负面训练 (TNT) 结果为更新后的分布与原始分布保持接近,不同于现有的负面信号损失函数后者会压低概率但不控制更新后的分布将是什么。在实验中,我们展示了TNT在在减少不良行为与维持模型生成行为之间取得更好的权衡,为基于迭代训练更新的建模范式铺平了道路,这种范式约束模型不生成不良输出,同时保留其惊人的能力。
引用
@article{arxiv.2406.13660,
title = {Towards Minimal Targeted Updates of Language Models with Targeted Negative Training},
author = {Lily H. Zhang and Rajesh Ranganath and Arya Tafvizi},
journal= {arXiv preprint arXiv:2406.13660},
year = {2024}
}
备注
Published in Transactions of Machine Learning Research