训练与预测数据差异:含噪声历史数据文本分类的挑战
信息检索
2018-09-12 v1 计算与语言
机器学习
机器学习
摘要
用于文本分类的工业数据集很少是为此目的而创建的。多数情况下,数据与目标预测是累积历史数据的副产品,通常在基于文本的文档及目标标签中均存在噪声。本文探讨:在含噪声的历史数据上计算的性能指标,能在多大程度上反映预期未来机器学习模型输入上的性能。结果表明,利用脏训练数据集可为更干净(且不同)的预测输入构建预测模型。
引用
@article{arxiv.1809.04019,
title = {Training and Prediction Data Discrepancies: Challenges of Text Classification with Noisy, Historical Data},
author = {Emilia Apostolova and R. Andrew Kreek},
journal= {arXiv preprint arXiv:1809.04019},
year = {2018}
}
备注
2018 The 4th Workshop on Noisy User-generated Text (W-NUT)