以 10 亿人格(1,000,000,000 Personas)规模构建合成数据
计算与语言
2025-05-09 v3 机器学习
摘要
我们提出了一种新颖的人格驱动数据合成方法,利用大型语言模型(LLM)中的各种视角来创建多样化的合成数据。为充分利用该方法在规模上的潜力,我们引入了 Persona Hub——一个来自网络数据的 10 亿多样化人格的集合。这些 10 亿人格(约占全球人口的 13%),作为分布式的世界知识载体,可以几乎涵盖 LLM 中所包含的几乎所有视角,从而大规模地为各种场景创建多样化的合成数据。通过展示 Persona Hub 在规模化创建高质量数学和逻辑推理问题、指令(即用户提示)、知识丰富文本、游戏 NPC 和工具(函数)等用例中,我们证明了人格驱动的数据合成具有多样性、可扩展性、灵活性和易用性,可能在实践中推动合成数据创建和应用的范式转变,这可能对 LLM 研究和开发产生深远影响。
引用
@article{arxiv.2406.20094,
title = {Scaling Synthetic Data Creation with 1,000,000,000 Personas},
author = {Tao Ge and Xin Chan and Xiaoyang Wang and Dian Yu and Haitao Mi and Dong Yu},
journal= {arXiv preprint arXiv:2406.20094},
year = {2025}
}
备注
Work in progress