VOYAGER:一种利用大语言模型生成多样化数据集的无需训练方法
计算与语言
2026-04-29 v2 机器学习
摘要
大语言模型 (LLMs) 日益被用于生成合成数据集,以供下游模型的评估和训练使用。然而,先前的研究指出此类生成数据缺乏多样性。本文提出 Voyager,一种生成多样化数据集的新型原则性方法。我们的方法是迭代的,直接优化一个数学量,利用行列式点过程的机制来优化数据集的多样性。此外,我们的方法无需训练,适用于闭源模型,且具有可扩展性。除了为方法的有效性提供理论依据外,我们还通过全面的实验证明,Voyager 在多样性方面相比流行的基线方法实现了 1.5-3 倍的显著提升。
引用
@article{arxiv.2512.12072,
title = {VOYAGER: A Training Free Approach for Generating Diverse Datasets using LLMs},
author = {Avinash Amballa and Yashas Malur Saidutta and Chi-Heng Lin and Vivek Kulkarni and Srinivas Chappidi},
journal= {arXiv preprint arXiv:2512.12072},
year = {2026}
}
备注
Accepted to ACL 2026 Main