中文

自然语言处理中文本数据增强的评估指标

计算与语言 2024-02-13 v1 人工智能

摘要

近期关于自然语言处理数据增强的综述报告了该领域的不同技术与进展。多个框架、工具和代码库促进了文本数据增强管道的实现。然而,由于任务、指标、数据集、架构和实验设置的不同,缺乏评估标准和比较方法,使得比较失去意义。此外,方法缺乏统一性,文本数据增强研究将受益于统一指标以比较不同的增强方法。因此,学术界和工业界致力于为文本数据增强技术提供相关的评估指标。本文的贡献在于提供文本增强方法评估指标的分类法,并为统一基准提供方向。所提出的分类法组织了包括实现工具和指标计算在内的类别。最后,通过本研究,我们旨在呈现探索文本数据增强指标统一化和标准化的机会。

关键词

引用

@article{arxiv.2402.06766,
  title  = {Evaluation Metrics for Text Data Augmentation in NLP},
  author = {Marcellus Amadeus and William Alberto Cruz Castañeda},
  journal= {arXiv preprint arXiv:2402.06766},
  year   = {2024}
}