通过 ensembles 小型语言模型净化大型语言模型
计算与语言
2024-02-26 v1 人工智能
机器学习
摘要
大型语言模型(LLM)的快速发展离不开收集来自外部(不可信)来源的大量训练数据。尽管已为数据清洗和筛选付出了大量努力,但报告称,优秀的 LLM 仍可能遭受版权侵权、数据投毒及隐私违规等问题,这会阻碍其实际部署。本研究提出一种简单且易于实现的方法,通过与良好且小型语言模型(SLM)进行 ensembles 来净化 LLM 受未筛选数据负面影响。除理论保证外,我们进行了全面实验来实证确认通过与 SLM 进行 ensembles 有效改善 LLM 的效果,能够在保持性能的同时,减轻版权侵权、数据投毒及隐私违规等问题。
引用
@article{arxiv.2402.14845,
title = {Purifying Large Language Models by Ensembling a Small Language Model},
author = {Tianlin Li and Qian Liu and Tianyu Pang and Chao Du and Qing Guo and Yang Liu and Min Lin},
journal= {arXiv preprint arXiv:2402.14845},
year = {2024}
}