SynthBio:人机协作标注文本数据集的案例研究
计算与语言
2022-01-14 v2 人工智能
机器学习
摘要
NLP研究者需要更多更高质量的文本数据集。人工标注数据集收集成本高昂,而通过网页自动检索收集的数据集(如WikiBio)存在噪声且可能包含不期望的偏差。此外,网络来源数据常包含于用于预训练模型的数据集中,导致训练集与测试集的意外交叉污染。本工作中我们引入一种高效数据集标注新方法:利用大语言模型为人类评分者提供种子生成内容,从而将数据集创作从写作任务转变为编辑任务。我们使用该方法标注了SynthBio——一个由描述虚构个体的结构化属性列表映射到自然语言传记的WikiBio新评测集。我们表明,我们的虚构传记数据集比WikiBio噪声更少,且在性别与国籍上更为均衡。
引用
@article{arxiv.2111.06467,
title = {SynthBio: A Case Study in Human-AI Collaborative Curation of Text Datasets},
author = {Ann Yuan and Daphne Ippolito and Vitaly Nikolaev and Chris Callison-Burch and Andy Coenen and Sebastian Gehrmann},
journal= {arXiv preprint arXiv:2111.06467},
year = {2022}
}
备注
10 pages, 2 figures, accepted to NeurIPS 2021 Datasets and Benchmarks Track