中文

利用深度主动学习识别公开临床记录中的低资源移动功能信息

计算与语言 2023-11-28 v1

摘要

功能日益被认为是全人健康的重要指标,尽管在临床自然语言处理研究中很少受到关注。我们引入了首个专门针对国际功能、残疾和健康分类(ICF)中移动领域的公开标注数据集,旨在促进从自由文本临床记录中自动提取和分析功能信息。我们利用国家 NLP 临床挑战(n2c2)研究数据集,通过关键词扩展构建候选句子池。我们的主动学习方法采用按密度代表性加权的委员会查询采样,筛选信息量大的句子供人工标注。我们训练 BERT 和 CRF 模型,并利用这些模型的预测来指导后续标注迭代中新句子的选择。我们的最终数据集包含 4,265 个句子,共计 11,784 个实体,包括 5,511 个动作实体、5,328 个移动实体、306 个辅助实体和 639 个量化实体。标注者间一致性(IAA)在所有实体类型上平均,精确匹配为 0.72,部分匹配为 0.91。我们还训练并评估了常见的 BERT 模型和先进的嵌套 NER 模型。最佳 F1 分数分别为:动作 0.84、移动 0.7、辅助 0.62、量化 0.71。实证结果表明 NER 模型从临床文本中准确提取移动功能信息具有良好潜力。我们标注数据集的公开可用将促进进一步研究以全面获取电子健康记录(EHRs)中的功能信息。

关键词

引用

@article{arxiv.2311.15946,
  title  = {Leveraging deep active learning to identify low-resource mobility functioning information in public clinical notes},
  author = {Tuan-Dung Le and Zhuqi Miao and Samuel Alvarado and Brittany Smith and William Paiva and Thanh Thieu},
  journal= {arXiv preprint arXiv:2311.15946},
  year   = {2023}
}