中文

提取并理解对齐中的表层知识

计算与语言 2025-02-10 v1 人工智能

摘要

使大型语言模型与人类价值观和偏好对齐,通常通过基于人类反馈的微调来实现,这对于确保安全且负责任的 AI 行为至关重要。然而,该过程通常需要大量的数据和计算资源。最近的研究表明,通过更简单的方法(如上下文学习),可能以更低的成本实现对齐。这引出了一个问题:对齐主要是表层的吗?在本文中,我们深入探讨了这个问题并提供了定量分析。我们将表层知识概念化,将其定义为可以通过简单的词元重塑获取的知识,且不影响模型捕捉词元间潜在因果关系的能力。我们提出了一种从对齐模型中提取和分离表层知识的方法,重点关注对最终词元选择过程的浅层修改。通过将仅增强了表层知识的模型与完全对齐的模型进行比较,我们量化了对齐中表层知识的比例。我们的发现表明,尽管表层知识构成了对齐的很大一部分,特别是在安全性和去毒任务中,但它并不是全部。需要推理和上下文理解的任务仍然依赖于更深层的知识。此外,我们展示了分离出的表层知识的两个实际优势:(1)它可以在模型之间转移,从而利用从较小模型中提取的表层知识实现对更大模型的高效离场对齐;(2)它是可恢复的,允许在不牺牲性能的情况下恢复受损模型的对齐状态。

关键词

引用

@article{arxiv.2502.04602,
  title  = {Extracting and Understanding the Superficial Knowledge in Alignment},
  author = {Runjin Chen and Gabriel Jacob Perin and Xuxi Chen and Xilun Chen and Yan Han and Nina S. T. Hirata and Junyuan Hong and Bhavya Kailkhura},
  journal= {arXiv preprint arXiv:2502.04602},
  year   = {2025}
}