SPA:面向知识注入的简单但难以超越的基线
机器学习
2026-03-24 v1 人工智能
计算与语言
摘要
虽然大型语言模型(LLM)在大规模数据上进行预训练,但其知识覆盖范围在专门且数据稀缺的领域仍不完整,这推动了广泛研究合成数据生成以进行知识注入。我们提出SPA(Scaling Prompt-engineered Augmentation),即一种简单却难以超越的基线方法,通过精心设计的少量提示词生成大规模合成数据进行知识注入。通过系统性比较,我们发现SPA优于多个强大基线。进一步,我们识别了先前方法的两个关键局限性:(1)虽然基于强化学习的方法在小规模下可能提高 LLM 数据增强的 token 效率,但在数据规模扩大时会出现多样性坍缩,导致报酬递减;(2)虽然多阶段提示可能在简单增强方法上表现更好,但在仔细的提示调优后,这些优势可能会消失。我们的结果表明,对于知识注入而言,精心设计的提示配合直观的大规模增强可能效果出人意料,我们希望SPA能为该领域的未来研究提供强大的基线。我们的代码已公开于 https://github.com/Tangkexian/SPA。
引用
@article{arxiv.2603.22213,
title = {SPA: A Simple but Tough-to-Beat Baseline for Knowledge Injection},
author = {Kexian Tang and Jiani Wang and Shaowen Wang and Kaifeng Lyu},
journal= {arXiv preprint arXiv:2603.22213},
year = {2026}
}