面向训练语言模型的数据过滤方法
计算与语言
2026-05-29 v1 人工智能
机器学习
摘要
数据质量是机器学习模型效果的关键因素。即使在广泛使用的基准数据集中存在标签错误,这些错误会引入训练数据的噪声并降低模型的泛化能力。本文对两种自动标签错误检测方法——自信学习(Confident Learning)和数据图景(Dataset Cartography)在三个规模、类别数和领域各不相同的俄语文本分类语料库上的进行比较分析:ru_emotion_e-culture(49,123个样本,情感分类)、RuCoLA(8,524个样本,语言可接受性)以及TERRa(2,337个样本,文本蕴涵识别)。我们使用在每个语料库上微调的预训练模型rubert-base-cased。为验证过滤的有意义性,我们进行了以随机删除等效数量样本为控制的实验。结果表明,两种方法的有效性在数据集特征上具有强烈依赖性:在大规模数据集且噪声水平较低时,过滤无法提升性能;而在小数据集且噪声较高时,自信学习可显著改善F1-macro指标。数据图景表现更为保守,删除的样本数量更少。无论针对哪些语料库,两种方法均优于随机删除,确认了这些方法的合理性。
引用
@article{arxiv.2605.29807,
title = {Data filtering methods for training language models},
author = {Egor Shevchenko and Elena Bruches},
journal= {arXiv preprint arXiv:2605.29807},
year = {2026}
}
备注
AINL-2026