中文

人工不流利检测,呃不,面向大众的不流利生成

计算与语言 2022-11-18 v1

摘要

现有的不流利检测方法通常要求存在大规模标注数据集。然而,该任务的当前数据集有限、存在类别不平衡,且缺乏真实场景中可能遇到的某些类型的不流利。本文提出LARD,一种从流利文本自动生成人工不流利的方法。LARD可基于reparandum/interregnum标注方案模拟所有不同类型的不流利(重复、替换和重启)。此外,它将上下文嵌入引入不流利生成,以产生真实的上下文感知人工不流利。由于所提方法仅需流利文本,它可直接用于训练,绕过了对标注不流利数据的需求。我们的实证评估表明,在无可用的或仅有极少数据时,LARD确实可有效使用。此外,我们的详细分析表明,所提方法生成了真实的不流利并提升了现有不流利检测器的准确率。

关键词

引用

@article{arxiv.2211.09235,
  title  = {Artificial Disfluency Detection, Uh No, Disfluency Generation for the Masses},
  author = {T. Passali and T. Mavropoulos and G. Tsoumakas and G. Meditskos and S. Vrochidis},
  journal= {arXiv preprint arXiv:2211.09235},
  year   = {2022}
}

备注

10 pages