中文

通过提示干预控制大语言模型中的等式推理

计算与语言 2025-01-14 v5 历史与综述

摘要

本文研究如何通过符号数据生成框架控制大语言模型(LLMs)的幻觉率,探讨特定数学错误率与输入干预类型之间的基本关系。具体而言,我们利用符号引擎系统性地生成用于推导生成任务的数据,并对提示施加针对性干预,以扰动数学推导的特征,例如符号的表面形式、等式树结构和数学上下文。随后,我们评估了一系列 LLM 上的提示干预效果,包括微调的 T5 模型、GPT 以及基于 LLaMa 的模型。我们的实验表明,在通过该框架生成的多个评估集上,T5-Large 可以胜过 GPT-4 的少样本性能。然而,基于人工分析、基于模板的错误检测和文本生成指标的广泛评估揭示了参考型指标单独描述之外的模型弱点。我们利用这些结果将干预的特征分布足迹与 LLM 推导质量的人工评估联系起来,从而有可能针对特定类型的错误对语言模型的细粒度数学能力实现显著控制。

关键词

引用

@article{arxiv.2307.09998,
  title  = {Controlling Equational Reasoning in Large Language Models with Prompt Interventions},
  author = {Jordan Meadows and Marco Valentino and Andre Freitas},
  journal= {arXiv preprint arXiv:2307.09998},
  year   = {2025}
}

备注

AAAI 2025 (7 pages)