中文

临床试验潜在核心结局的自动编译

计算与语言 2021-01-12 v1 机器学习

摘要

由于对临床试验结局与分析的获取增加,研究人员与科学家能够更有效地迭代或改进相关方法。然而,临床试验的指标与相关结果在其报告中通常未遵循任何标准化,使研究人员更难解析不同试验的结果。本文的目标是描述一种利用自然语言处理以刻画临床试验可能核心结局的自动化方法,以缓解围绕异质临床试验结局的问题。由于该过程性质为领域特定,采用了 BioBERT 以执行多类实体归一化任务。除 BioBERT 外,还使用了一种仅利用结局与标签的编码器输出嵌入表示的无监督基于特征的方法。最后,计算跨向量的余弦相似度以获得语义相似度。该方法既能利用来自 BioBERT 模型所学嵌入的每个 token 的领域特定上下文,也能获得更稳定的句子相似度度量。利用 Jaccard 相似度在各分类中识别的一些常见结局被编集,尽管其中部分不可行,但建立了可开展此自动化过程的流水线。

关键词

引用

@article{arxiv.2101.04076,
  title  = {Automating the Compilation of Potential Core-Outcomes for Clinical Trials},
  author = {Shwetha Bharadwaj and Melanie Laffin},
  journal= {arXiv preprint arXiv:2101.04076},
  year   = {2021}
}