中文

评估文本数据质量对特征表示与机器学习模型的影响

计算与语言 2025-02-14 v1

摘要

背景:受控环境中收集的数据通常导致高质量数据集。然而,在实际应用中,数据收集质量常受妥协。众所周知,数据集的质量对机器学习模型性能具有显著影响。方法:开发了一种粗糙的错误率指标,用于在 token 级别评估文本数据集的质量。采用 Mixtral 大型语言模型(LLM)对低质量数据集中的错误进行量化和纠正。该研究分析了两个医疗保健数据集:高质量的公开医院数据集 MIMIC-III 和来自澳大利亚养老院的低质量私有数据集 ACH。我们在 MIMIC 中以不同 rate 引入错误,同时使用 LLM 改善 ACH 数据集的质量。结果:对于来自 MIMIC 和 ACH 数据集分别抽样的 35,774 名和 6,336 名患者,我们使用 Mixtral 在 MIMIC 中引入错误并纠正 ACH 中的错误。Mixtral 在 63% 的病程记录中正确检测到错误,其中 17% 包含因医学术语导致的单 token 误分类。LLM 在解决各种错误方面显示出提升病程记录质量的潜力。在不同 error rate 下,特征表示性能对低 error rate(<10%)具有容忍性,但在更高 rate 时显著下降。结论:该研究表明,在 error rate <10% 的数据集上,模型表现相对良好,但随着 error rate 提升至 >=10%,模型性能显著下降。因此,在利用机器学习任务之前评估数据集质量至关重要。对于 error rate 较高的数据集,必须实施纠正措施,以确保机器学习模型的可靠性和有效性。

关键词

引用

@article{arxiv.2502.08669,
  title  = {Assessing the Impact of the Quality of Textual Data on Feature Representation and Machine Learning Models},
  author = {Tabinda Sarwar and Antonio Jose Jimeno Yepes and Lawrence Cavedon},
  journal= {arXiv preprint arXiv:2502.08669},
  year   = {2025}
}