中文

标注数据不足?只需加入语义:一种用于推断在线健康文本的数据高效方法

计算与语言 2023-09-19 v1

摘要

网络上和社交平台上可用的用户生成文本通常较长且语义上具有挑战性,难以标注。随着问题领域变得更为专门化,获取人工标注愈发困难。例如,许多健康 NLP 问题需要领域专家参与标注流程。因此,开发能够应对这类有限数据问题的低资源 NLP 方案至关重要。本研究中,我们采用抽象意义表示(Abstract Meaning Representation, AMR)图来建模源自各类在线健康资源与社区的低资源健康 NLP 任务。AMR 非常适合建模在线健康文本,因其可表示多句输入、抽离复杂术语,并建模共指 token 间的长距离关系。因此,AMR 提升了预训练语言模型对高复杂度文本的推理能力。我们的实验表明,通过将文本嵌入与语义图嵌入增强,可在 6 个低资源健康 NLP 任务上提升性能。我们的方法任务无关,且易于并入任何标准文本分类流程。我们通过两种文本复杂度度量——Flesch Kincaid 阅读等级与句法复杂度——的视角分析性能,实验验证了 AMR 在复杂文本建模中的有用性。我们的误差分析显示,注入 AMR 的语言模型在复杂文本上表现更好,且在复杂度变化时通常表现出更小的预测方差。

关键词

引用

@article{arxiv.2309.09877,
  title  = {Not Enough Labeled Data? Just Add Semantics: A Data-Efficient Method for Inferring Online Health Texts},
  author = {Joseph Gatto and Sarah M. Preum},
  journal= {arXiv preprint arXiv:2309.09877},
  year   = {2023}
}