TaP:面向自动化和可扩展的偏好数据生成的分类学指导框架
计算与语言
2026-02-24 v4
摘要
对大型语言模型(LLM)进行监督和偏好微调需要高质量的数据集来提高其遵循指令能力并与人类偏好和价值观保持一致。然而,构建此类数据集的成本高昂,且大多数公开数据集为英文。为此,我们提出了 \underline{\textbf{Ta}}xonomy-Guided \underline{\textbf{P}}reference Data Generation(TaP)框架,用于跨语言的自动化、可扩展偏好数据集构建。TaP 使用结构化分类学提供对数据集组成的细粒度控制,确保其多样性和广泛覆盖。我们使用 TaP 生成的数据集对多种 LLM 进行监督和偏好微调。实验结果表明,使用 TaP 生成的数据集训练的 LLM 在与使用现有开源数据集训练的模型相比,表现更佳。令人惊讶的是,使用 TaP 生成的数据集训练的 LLM 所表现的模型,在使用 180 倍大小的开源数据集训练的模型之上,也展现出优异的性能。
引用
@article{arxiv.2506.23979,
title = {TaP: A Taxonomy-Guided Framework for Automated and Scalable Preference Data Generation},
author = {Renren Jin and Tianhao Shen and Xinwei Wu and Dan Shi and Haoran Sun and Yuqi Ren and Wuwei Huang and Quandong Wang and Wei Liu and Jian Luan and Bin Wang and Deyi Xiong},
journal= {arXiv preprint arXiv:2506.23979},
year = {2026}
}
备注
33 pages, 16 tables, 10 figures