EmbGen:使用重组语料库进行教学
计算与语言
2026-05-20 v1 人工智能
摘要
将小型指令调优模型适应特定领域通常依赖于针对精选指令-响应示例进行监督微调(SFT),但规模化收集此类示例成本较高。由教师LLM从领域语料库生成的合成训练示例可以降低此成本,但现有管道会产生均质化输出,且不一致地捕捉跨段落或跨文档依赖关系。我们介绍EmbGen,一种语料库分解为实体-描述对的合成数据生成管道,通过从嵌入相似性推断的语义结构将其重组,然后通过基于相似性、簇内采样和簇间采样生成问答对,并使用聚类特化系统提示。我们在三个语义异构性不同的数据集上对EmbGen进行评估,使用EntiGraph、InstructLab和Knowledge-Instruct作为基准,在固定token预算(500万和2000万token)下进行测试。我们使用词汇重叠指标、LLM评判评分标准以及Binary Accuracy——一种结合事实准确性和完整性的组合指标进行评估。在最异质的数据集上,EmbGen在500万token预算下将Binary Accuracy提高12.5%,在2000万token预算下提升88.9%,相对于最强的基线;在其他异构性较低的数据集上仍保持与基线的竞争力。
引用
@article{arxiv.2605.19394,
title = {EmbGen: Teaching with Reassembled Corpora},
author = {Arun K Lenin and Kai Rouse and Andrea Nicastro and Anna Leontjeva},
journal= {arXiv preprint arXiv:2605.19394},
year = {2026}
}
备注
8 pages, 4 images (32 pages with appendix)