中文

SynthBio:人机协作标注文本数据集的案例研究

计算与语言 2022-01-14 v2 人工智能 机器学习

摘要

NLP研究者需要更多更高质量的文本数据集。人工标注数据集收集成本高昂,而通过网页自动检索收集的数据集(如WikiBio)存在噪声且可能包含不期望的偏差。此外,网络来源数据常包含于用于预训练模型的数据集中,导致训练集与测试集的意外交叉污染。本工作中我们引入一种高效数据集标注新方法:利用大语言模型为人类评分者提供种子生成内容,从而将数据集创作从写作任务转变为编辑任务。我们使用该方法标注了SynthBio——一个由描述虚构个体的结构化属性列表映射到自然语言传记的WikiBio新评测集。我们表明,我们的虚构传记数据集比WikiBio噪声更少,且在性别与国籍上更为均衡。

关键词

引用

@article{arxiv.2111.06467,
  title  = {SynthBio: A Case Study in Human-AI Collaborative Curation of Text Datasets},
  author = {Ann Yuan and Daphne Ippolito and Vitaly Nikolaev and Chris Callison-Burch and Andy Coenen and Sebastian Gehrmann},
  journal= {arXiv preprint arXiv:2111.06467},
  year   = {2022}
}

备注

10 pages, 2 figures, accepted to NeurIPS 2021 Datasets and Benchmarks Track