中文

揭示并提升数据可信度:一项基于无害语言模型训练数据集的研究

机器学习 2024-03-26 v2 人工智能 计算与语言 计算机与社会

摘要

语言模型在各种任务中展现出前景,但在训练、微调或对齐过程中可能受到不良数据的影响。例如,若一些不安全对话被错误标注为安全对话,则在这些样本上微调的模型可能是有害的。因此,标注的正确性即数据集的可信度十分重要。本研究聚焦于真实世界数据集的可信度,包括流行的基准 Jigsaw Civil Comments、Anthropic Harmless & Red Team、PKU BeaverTails & SafeRLHF,它们可用于训练无害语言模型。鉴于人工清理这些数据集的成本与困难,我们引入一个系统框架用于评估数据集可信度、识别标签错误并评估策展语言数据中噪声标签的影响,特别关注不安全评论与对话分类。借助该框架,我们在由上述基准构建的 11 个数据集中发现并修正了平均 6.16% 的标签错误。通过直接修正标签错误,数据可信度与下游学习性能可显著提升,表明清理现有真实世界数据集的重要性。我们提供了一个开源工具 Docta 用于数据清理,位于 https://github.com/Docta-ai/docta。

关键词

引用

@article{arxiv.2311.11202,
  title  = {Unmasking and Improving Data Credibility: A Study with Datasets for Training Harmless Language Models},
  author = {Zhaowei Zhu and Jialu Wang and Hao Cheng and Yang Liu},
  journal= {arXiv preprint arXiv:2311.11202},
  year   = {2024}
}

备注

ICLR 2024