中文

通过多智能体仿真合成大语言模型后训练数据

人工智能 2025-02-21 v2 计算与语言

摘要

后训练对于使大语言模型 (LLM) 跟随人类指令至关重要,但其有效性取决于高质量的指令数据,而在现实世界中由于隐私 concerns、数据稀缺和高标注成本,这些数据难以获得。为填补这一空白,灵感来自近期成功将 LLM 用于模拟人类社会,我们提出了 MATRIX,一个多智能体仿真器,自动生成多样化的文本场景,捕捉广泛的现实人类需求。利用这些输出,我们引入了一种新颖的基于情景的指令生成器 MATRIX-Gen,用于可控且高度真实的数据合成。大量实验表明,该框架有效地生成了通用和领域特定数据。实验表明,仅用20K条指令-响应对训练的 Llama-3-8B-Base 在 AlpacaEval 2 和 Arena-Hard benchmark 上,优于在1000万对以上数据上训练的 Meta Llama-3-8B-Instruct 模型。

关键词

引用

@article{arxiv.2410.14251,
  title  = {Synthesizing Post-Training Data for LLMs through Multi-Agent Simulation},
  author = {Shuo Tang and Xianghe Pang and Zexi Liu and Bohan Tang and Rui Ye and Tian Jin and Xiaowen Dong and Yanfeng Wang and Siheng Chen},
  journal= {arXiv preprint arXiv:2410.14251},
  year   = {2025}
}