中文

训练与预测数据差异:含噪声历史数据文本分类的挑战

信息检索 2018-09-12 v1 计算与语言 机器学习 机器学习

摘要

用于文本分类的工业数据集很少是为此目的而创建的。多数情况下,数据与目标预测是累积历史数据的副产品,通常在基于文本的文档及目标标签中均存在噪声。本文探讨:在含噪声的历史数据上计算的性能指标,能在多大程度上反映预期未来机器学习模型输入上的性能。结果表明,利用脏训练数据集可为更干净(且不同)的预测输入构建预测模型。

关键词

引用

@article{arxiv.1809.04019,
  title  = {Training and Prediction Data Discrepancies: Challenges of Text Classification with Noisy, Historical Data},
  author = {Emilia Apostolova and R. Andrew Kreek},
  journal= {arXiv preprint arXiv:1809.04019},
  year   = {2018}
}

备注

2018 The 4th Workshop on Noisy User-generated Text (W-NUT)