利用 BREAD 区分文本中的精华与糟粕:用于检测文本冗余的开源基准与指标
计算与语言
2023-11-14 v1 机器学习
摘要
数据质量是 NLP 领域一个反复出现的问题,无论任务、领域或架构如何,对于低资源语言尤其严重。一个典型且隐蔽的问题,同时影响训练数据与模型输出,是重复且由语言上无趣的样板内容(如价格目录或计算机生成的日志文件)主导的数据。尽管该问题普遍存在于许多网络抓取语料中,迄今尚无可供测试的基准,也没有系统性研究来寻找跨语言泛化且与人类数据质量判断一致的简单指标。在本文中,我们创建并发布了 BREAD,一个关于重复性样板内容与合理语言内容的人工标注基准,涵盖 360 种语言。我们同时发布了若干基线 CRED(字符冗余)分数,并评估了它们在 BREAD 上的有效性。我们希望社区能利用该资源开发更好的过滤方法,并且我们的 CRED 分数参考实现能成为标准语料评估工具,推动更干净的语言建模语料的发展,尤其是在低资源语言中。
引用
@article{arxiv.2311.06440,
title = {Separating the Wheat from the Chaff with BREAD: An open-source benchmark and metrics to detect redundancy in text},
author = {Isaac Caswell and Lisa Wang and Isabel Papadimitriou},
journal= {arXiv preprint arXiv:2311.06440},
year = {2023}
}
备注
Accepted to GEM workshop 2023; 6 pages