何种语言被视为高质量?文本数据选择中的语言意识形态度量
计算与语言
2022-01-27 v2 人工智能
摘要
语言模型日益依赖大规模网络转储以获取多样化文本数据。然而,这些来源充斥着不良内容。因此,诸如维基百科、书籍与新闻电讯等资源常作为自动筛选最适于语言建模的网络文本的锚点,该过程通常被称为质量过滤。利用一个由美国高中生校报文章(由全国学生撰写)组成的新数据集,我们考察 GPT-3 所用质量过滤器偏好何种语言。我们发现,来自规模更大、位于更富裕、受教育程度更高且城市化 ZIP 编码区域学校的校报更可能被分类为高质量。我们随后证明,过滤器对质量的度量与其他合理指标(如事实性或文学声誉)并不一致。我们认为,将任何语料特权化为高质量都蕴含一种语言意识形态,构建语言模型训练语料需更为审慎,并对各类文本的纳入或排除提供更好的透明性与合理性说明。
引用
@article{arxiv.2201.10474,
title = {Whose Language Counts as High Quality? Measuring Language Ideologies in Text Data Selection},
author = {Suchin Gururangan and Dallas Card and Sarah K. Dreier and Emily K. Gade and Leroy Z. Wang and Zeyu Wang and Luke Zettlemoyer and Noah A. Smith},
journal= {arXiv preprint arXiv:2201.10474},
year = {2022}
}