中文

一种用于挖掘含噪声健康相关文本源的无监督可定制错拼生成器

计算与语言 2023-06-21 v1

摘要

在本文中,我们提出一个可定制的数据中心系统,可自动为复杂的健康相关术语生成常见错拼。该拼写变体生成器依赖于从大规模无标签文本中学习到的稠密向量模型,用于寻找与原始/种子关键词语义相近的术语,随后过滤掉词法差异超出给定阈值的术语。该过程递归执行,当未发现与种子关键词相似(词法与语义)的新术语时收敛。词内字符序列相似度的加权允许对系统进行进一步的问题特定定制。在一个为本研究准备的数据集上,我们的系统在药物名称变体生成上优于当前最优方法,最佳 F1 值为 0.69,F1/4 值为 0.78。在一组癌症相关术语上对该系统的外部评估显示,当纳入生成的变体时,从 Twitter 帖子的检索率提升了超过 67%。我们提出的拼写变体生成器相较于当前最优方法和其他类型变体生成器具有若干优势——(i) 能够过滤掉词法相似但语义不相似的术语,(ii) 生成的变体数量少,因为许多低频和歧义错拼被过滤掉,(iii) 系统完全自动、可定制且易于执行。虽然基础系统完全无监督,我们展示了如何利用监督来调整权重以实现任务特定定制。我们所提方法的性能与显著的相对简洁性,使其成为从噪声源进行健康相关文本挖掘的亟需错拼生成资源。该系统的源代码已公开供研究使用。

关键词

引用

@article{arxiv.1806.00910,
  title  = {An unsupervised and customizable misspelling generator for mining noisy health-related text sources},
  author = {Abeed Sarker and Graciela Gonzalez-Hernandez},
  journal= {arXiv preprint arXiv:1806.00910},
  year   = {2023}
}