中文

聚类与排序:通过专家对齐质量评估实现多样性保持的指令选择

计算与语言 2024-11-19 v3

摘要

随着开源社区的贡献,海量的指令微调(IT)数据应运而生。鉴于模型训练和评估所需的巨大资源分配,拥有一种高效选择高质量 IT 数据的方法是有利的。然而,现有的指令数据选择方法存在局限性,例如依赖脆弱的外部 API、受 GPT 模型偏见影响或降低所选指令数据集的多样性。在本文中,我们提出了一种工业友好、专家对齐且保持多样性的指令数据选择方法:聚类与排序(CaR)。CaR 采用两步过程:首先,使用与专家偏好对齐的高精度(84.25%)评分模型对指令对进行排序;其次,通过聚类保持数据集多样性。在我们的实验中,CaR 高效地仅选择了 Alpaca 1.96% 的 IT 数据,但生成的 AlpaCaR 模型在 GPT-4 评估中的表现平均超越了 Alpaca 32.1%。此外,我们发现无论预训练模型能力更强还是模型参数规模扩大,数据选择都是一致的范式。我们的方法采用参数量为 5.5 亿的紧凑模型,仅花费当前方法 11.2% 的资金支出,增强了其工业部署能力。

关键词

引用

@article{arxiv.2402.18191,
  title  = {Clustering and Ranking: Diversity-preserved Instruction Selection through Expert-aligned Quality Estimation},
  author = {Yuan Ge and Yilun Liu and Chi Hu and Weibin Meng and Shimin Tao and Xiaofeng Zhao and Hongxia Ma and Li Zhang and Boxing Chen and Hao Yang and Bei Li and Tong Xiao and Jingbo Zhu},
  journal= {arXiv preprint arXiv:2402.18191},
  year   = {2024}
}

备注

Accepted by EMNLP2024