如何在大型语言模型优化中保护版权数据?
机器学习
2023-08-24 v1 计算与语言
摘要
大型语言模型(LLMs)与生成式 AI 在计算机研究与应用领域发挥了变革性作用。关于这些模型是否会输出受版权保护的数据引发了争议,若模型训练数据受版权保护则可能发生此类情况。LLMs 建立在 transformer 神经网络架构之上,而该架构又依赖于一种称为 Attention 的数学计算,其使用 softmax 函数。本文中,我们表明大型语言模型的训练与优化可视为一个 softmax 回归问题。随后,我们建立了一种高效执行 softmax 回归的方法,其能防止回归函数生成版权数据。这确立了以一种避免生成版权数据的方式训练大型语言模型的理论方法。
引用
@article{arxiv.2308.12247,
title = {How to Protect Copyright Data in Optimization of Large Language Models?},
author = {Timothy Chu and Zhao Song and Chiwun Yang},
journal= {arXiv preprint arXiv:2308.12247},
year = {2023}
}