AboutMe:利用网页自我描述记录英语预训练数据过滤器的影响
计算与语言
2024-06-24 v3
摘要
大型语言模型(LLM)的能力源自其预训练数据,模型开发始于数据整理。然而,在此初始阶段关于保留或移除哪些数据的决策缺乏审查。在我们的工作中,我们将网页文本(一种流行的预训练数据源)置于其社会和地理背景中。我们创建了一个包含 1030 万条网站创建者自我描述的新数据集,并提取了关于他们是谁以及来自哪里的信息:他们的主题兴趣、社会角色和地理归属。然后,我们进行了首次研究,调查十种“质量”过滤器和英语语言识别(langID)过滤器如何影响在这些社会维度上变化的网页。我们的实验揭示了数据整理中一系列隐含偏好:我们表明一些质量分类器起到主题领域过滤器的作用,而语言识别可能忽略来自世界某些地区的英语内容。总体而言,我们希望我们的工作能够鼓励关于预训练数据整理实践及其社会影响的新研究方向。
引用
@article{arxiv.2401.06408,
title = {AboutMe: Using Self-Descriptions in Webpages to Document the Effects of English Pretraining Data Filters},
author = {Li Lucy and Suchin Gururangan and Luca Soldaini and Emma Strubell and David Bamman and Lauren F. Klein and Jesse Dodge},
journal= {arXiv preprint arXiv:2401.06408},
year = {2024}
}
备注
28 pages, 13 figures. Association for Computational Linguistics (ACL) 2024