中文

告知而非展示:陈述性事实影响大语言模型的泛化方式

人工智能 2023-12-14 v1

摘要

我们研究了大语言模型(LLMs)如何从其训练数据中的抽象陈述性语句进行泛化。举例来说,考虑一个被提示生成2050年伦敦天气报告的LLM。一种可能性是报告中的温度与2023年报告的温度均值和方差相匹配(即匹配预训练的统计数据)。另一种可能性是,通过纳入2023年科学论文中关于气候变化的陈述性语句,报告预测了更高的温度。此类陈述性语句的一个例子是“到2050年全球气温将升高1C1^{\circ} \mathrm{C}”。为了测试抽象陈述性语句的影响,我们构建了LLM在陈述性信息和程序性信息上进行微调的任务。我们发现,陈述性语句会影响模型预测,即使它们与程序性信息相冲突。特别是,对陈述性语句SS进行微调会增加模型对SS逻辑结果的似然。陈述性语句的影响在三个领域中是一致的:对齐AI助手、预测天气和预测人口统计特征。通过一系列消融实验,我们表明陈述性语句的影响不能用基于关键词匹配的联想学习来解释。然而,陈述性语句对模型似然的绝对影响很小,并且随着模型规模(即从3.3亿到1750亿参数)的增长,其增加幅度出人意料地小。我们认为这些结果对AI风险(与“背叛性转折”相关)和公平性具有启示意义。

关键词

引用

@article{arxiv.2312.07779,
  title  = {Tell, don't show: Declarative facts influence how LLMs generalize},
  author = {Alexander Meinke and Owain Evans},
  journal= {arXiv preprint arXiv:2312.07779},
  year   = {2023}
}