中文

Donkii:标注错误检测方法能否发现指令微调数据集中的错误?

计算与语言 2024-02-23 v2

摘要

指令微调已成为大语言模型(LLM)训练流程中不可或缺的一部分,并被证明能带来显著的性能提升。在另一并行研究方向中,标注错误检测(AED)已成为检测黄金标准标签中质量问题的工具。然而,迄今为止 AED 方法的应用仅限于分类任务。AED 方法在语言生成场景中的泛化能力如何,仍是一个开放问题,而这类场景正随着 LLM 的普及变得愈发常见。在本文中,我们提出了首个针对指令微调数据上 AED 的新基准:DONKII。它包含三个由专家和半自动方法 enriched with error annotations 的指令微调数据集。我们还提出了一种针对指令微调数据的错误类型新分类法。我们发现所有三个数据集都包含明显错误,这些错误有时会直接传播到指令微调的 LLM 中。我们提出了四种面向生成式场景的 AED 基线方法,并在新引入的数据集上进行了广泛评估。我们的结果表明,选择正确的 AED 方法和模型规模确实至关重要,并得出了关于如何使用 AED 方法清洗指令微调数据的实用建议。

关键词

引用

@article{arxiv.2309.01669,
  title  = {Donkii: Can Annotation Error Detection Methods Find Errors in Instruction-Tuning Datasets?},
  author = {Leon Weber-Genzel and Robert Litschko and Ekaterina Artemova and Barbara Plank},
  journal= {arXiv preprint arXiv:2309.01669},
  year   = {2024}
}

备注

Camera ready version for LAW-XVIII