中文

Ethos:在正交参数空间中校正语言模型

计算与语言 2024-04-02 v2

摘要

语言模型(LMs)极大地推动了自然语言处理的研究。然而,LMs 也引发了关于生成有偏见或有害内容以及潜在泄露训练数据集中隐私信息的担忧。在本工作中,我们提出了一种新的高效方法 Ethos,用于校正 LMs 以减轻输出中的毒性和偏见并避免隐私泄露。Ethos 建立在任务算术之上。然而,与当前的任务算术算法不同,Ethos 在重构任务向量时区分了一般有益知识和不良知识。具体而言,Ethos 首先使用奇异值分解从预训练模型中获取一组主成分。然后,通过将任务向量投影到主成分上,Ethos 识别出编码一般或不良知识的主成分。Ethos 仅使用包含不良知识的任务向量执行取反操作,从而将对一般模型实用性的附带损害降至最低。我们在三个不同的任务上展示了我们方法的有效性:去偏、去毒和记忆遗忘。评估表明,与当前的任务算术方法相比,Ethos 在去除不良知识和保持整体模型性能方面更为有效。

关键词

引用

@article{arxiv.2403.08994,
  title  = {Ethos: Rectifying Language Models in Orthogonal Parameter Space},
  author = {Lei Gao and Yue Niu and Tingting Tang and Salman Avestimehr and Murali Annavaram},
  journal= {arXiv preprint arXiv:2403.08994},
  year   = {2024}
}