更好的数据集始于 RefineLab:面向高质量数据集精炼的自动优化
计算与语言
2025-11-11 v1
摘要
高质量问答(QA)数据集是可靠的大型语言模型(LLM)评估的基础,但即便是经专家打造的数据集也存在领域覆盖、难度分布错位和事实不一致等持续性差距。近期由生成模型驱动的数据集浪潮加剧了这些质量挑战。在本工作中,我们引入 RefineLab——首个自动将原始 QA 文本数据精炼为高质量数据集的 LLM 驱动框架,在可控 token 预算约束下实现高质量数据集精炼。RefineLab 采用一组目标质量属性(如覆盖范围和难度平衡)作为精炼目标,在预定义的 token 预算内进行选择性编辑,以确保实用性和效率。本质上,RefineLab 解决了一个受资源限制约束的优化问题:在尊重资源限制的前提下,尽可能提高 QA 样本的质量。凭借一组可用精炼操作(如改写、干扰项替换),RefineLab 以原始数据集、指定的一组目标质量维度和 token 预算为输入,确定应用于每个 QA 样本的精炼操作。该过程由分配模块引导,选择最优精炼策略以最大化整体数据集质量,同时遵守预算约束。实验表明,RefineLab 在覆盖范围、难度对齐、事实忠实度和干扰项质量等方面持续缩小与专家数据集的差距。RefineLab 开创了一条可扩展、可定制的数据集设计可重复路径,对 LLM 评估具有广泛意义。
引用
@article{arxiv.2511.06530,
title = {Better Datasets Start From RefineLab: Automatic Optimization for High-Quality Dataset Refinement},
author = {Xiaonan Luo and Yue Huang and Ping He and Xiangliang Zhang},
journal= {arXiv preprint arXiv:2511.06530},
year = {2025}
}