基于分布匹配的少量shot LLM合成数据
计算与语言
2025-02-18 v2 人工智能
摘要
随着大语言模型(LLM)的发展,其在上下文学习和少样本语言生成方面的能力显著提升。这推动了使用LLM生成高质量合成数据来增强像在线检索器或弱LLM等小型模型的性能。然而,LLM生成的合成数据常与真实数据在关键语言属性(如语气、语调、内容比例等)上存在差异。因此,直接将这些合成数据与真实数据混合可能扭曲原始数据分布,从而潜在地阻碍性能提升。为解决此问题,本文引入SynAlign:一个基于关键属性分布匹配的合成数据生成与过滤框架。在生成之前,SynAlign利用被高斯过程模型模拟的不确定性跟踪器,迭代选择与已选样本不同的数据簇作为新数据合成的示例,有效促进了对真实数据分布的高效探索与多样性。在生成后,采用最大均值差异(Maximum Mean Discrepancy)作为目标函数,学习每个合成数据的采样权重,确保其与真实数据分布的匹配。在多个文本预测任务上的实验表明,该方法显著提升了性能。我们还对一个在线检索器进行了线上A/B测试,表明SynAlign的有效性。
引用
@article{arxiv.2502.08661,
title = {Few-shot LLM Synthetic Data with Distribution Matching},
author = {Jiyuan Ren and Zhaocheng Du and Zhihao Wen and Qinglin Jia and Sunhao Dai and Chuhan Wu and Zhenhua Dong},
journal= {arXiv preprint arXiv:2502.08661},
year = {2025}
}
备注
10 pages, 5 figures, accepted at www 2025