面向中文疾病规范化的简单数据增强技术
计算与语言
2024-06-14 v3 人工智能
摘要
疾病名称规范化是医学领域的一项重要任务。它将各种格式书写的疾病名称分类为标准化名称,作为智能医疗系统中各种疾病相关功能的基础组成部分。然而,现有疾病名称规范化系统最显著的障碍是训练数据的严重短缺。为此,我们提出了一种新颖的数据增强方法,包含一系列数据增强技术和若干支撑模块,以帮助缓解该问题。我们提出的方法依赖于疾病名称的结构不变性(Structural Invariance)属性和疾病分类体系的层次(Hierarchy)属性。目标是使模型广泛理解疾病名称及疾病名称分类体系的层次结构。通过大量实验,我们表明所提方法在各种基线模型和训练目标上均展现出显著的性能提升,尤其在训练数据有限的场景下。
引用
@article{arxiv.2306.01931,
title = {Simple Data Augmentation Techniques for Chinese Disease Normalization},
author = {Wenqian Cui and Xiangling Fu and Shaohui Liu and Mingjun Gu and Xien Liu and Ji Wu and Irwin King},
journal= {arXiv preprint arXiv:2306.01931},
year = {2024}
}