大语言模型表示工程的分类学、机遇与挑战
机器学习
2025-10-09 v5 计算与语言
摘要
表示工程(RepE)是一种控制大语言模型(LLM)行为的新范式。与传统修改输入或微调模型的方法不同,RepE 直接操控模型的内部表示。因此,它可能提供更有效、更可解释、更数据高效且更灵活地控制模型行为的能力。我们提供了 RepE 领域的首个全面调查,综述快速增长的文献,以回答关键问题:RepE 方法存在哪些,如何不同?RepE 已用于哪些概念和问题?RepE 相较于其他方法存在哪些优势与不足?为此,我们提出了统一的框架将 RepE 描述为由表示识别、操作化和控制组成的管道。我们认为,尽管 RepE 方法具有显著潜力,但仍面临挑战,包括管理多个概念、确保可靠性以及保持模型性能。为了改进 RepE,我们识别了实验和方法学改进的机遇,并构建了最佳实践指南。
引用
@article{arxiv.2502.19649,
title = {Taxonomy, Opportunities, and Challenges of Representation Engineering for Large Language Models},
author = {Jan Wehner and Sahar Abdelnabi and Daniel Tan and David Krueger and Mario Fritz},
journal= {arXiv preprint arXiv:2502.19649},
year = {2025}
}