PaCE:面向大语言模型的精简概念工程
计算与语言
2024-11-06 v2 人工智能
信息检索
机器学习
摘要
大语言模型(LLM)正在被用于多种任务。尽管它们能够生成类似人的响应,但也会产生不可取的输出,包括潜在的有害信息、种族主义或性别歧视语言,以及幻觉现象。对齐方法旨在通过微调、提示工程和表示工程等技术来减少此类不可取的输出。然而,现有方法面临多个挑战:一些方法需要针对每个对齐任务进行昂贵的微调;一些方法未能充分删除不可取概念,导致对齐失败;一些方法则删除了良好概念,降低了大语言模型的语言能力。为此,我们提出了精简概念工程(PaCE),一种用于对齐的新型激活工程框架。首先,为了充分建模概念,我们在激活空间构建了一个大型概念词典,其中每个原子对应一个语义概念。给定任意对齐任务后,我们指示一个概念分区器高效地将概念标记为良好或不可取。随后,在推理时,我们通过稀疏编码将大语言模型的激活沿概念词典分解,以线性组合的方式准确地表示激活,包括良好和不可取成分。通过删除后者,重新定位大语言模型的行为,以实现对齐目标。我们在响应去暴力、忠实性增强和情感修正等任务上进行实验,表明PaCE在保持语言能力的同时,实现了对齐性能的国际前沿水平。
引用
@article{arxiv.2406.04331,
title = {PaCE: Parsimonious Concept Engineering for Large Language Models},
author = {Jinqi Luo and Tianjiao Ding and Kwan Ho Ryan Chan and Darshan Thaker and Aditya Chattopadhyay and Chris Callison-Burch and René Vidal},
journal= {arXiv preprint arXiv:2406.04331},
year = {2024}
}
备注
Accepted in NeurIPS 2024. GitHub repository at https://github.com/peterljq/Parsimonious-Concept-Engineering