中文

临床病历上的自监督答案检索

信息检索 2021-08-03 v1 计算与语言

摘要

从长文档中检索答案片段是一项复杂任务,需要对话语和文档上下文的语义理解。我们专门在临床场景中应对这一挑战,其中医生基于诊断和 other latent 医疗方面检索患者队列。我们引入 CAPR,一种基于规则的自监督目标,用于训练 Transformer 语言模型以进行领域特定的片段匹配。此外,我们贡献了一个基于临床病历的新检索数据集,以在大规模临床病历语料上模拟该场景。我们在四种基于 Transformer 的架构中应用我们的目标:Contextual Document Vectors、Bi-、Poly- 和 Cross-encoders。基于在 MIMIC-III 和另外三个医疗数据集上的广泛评估,我们报告 CAPR 在领域特定片段检索上优于强基线,并有效泛化到基于规则和人工标注的片段。这使得该模型在仅有有限训练数据可用的零样本场景中尤为强大。

关键词

引用

@article{arxiv.2108.00775,
  title  = {Self-supervised Answer Retrieval on Clinical Notes},
  author = {Paul Grundmann and Sebastian Arnold and Alexander Löser},
  journal= {arXiv preprint arXiv:2108.00775},
  year   = {2021}
}