中文

理解医疗对话:丰富转写、置信度评分与信息抽取

机器学习 2021-04-07 v1

摘要

本文描述可从医疗对话中抽取临床相关信息的新组件,这些组件将作为 Google API 提供。我们描述了一种基于 transformer 的循环神经网络转导器(RNN-T)模型,专为长音频定制,可生成包含说话人分割、说话人角色标注、标点与大小写的丰富转写。在代表性测试集上,我们比较了具有不同编码器、单元与流式约束的 RNN-T 模型性能。我们基于 transformer 的流式模型在 ASR 任务上约 20% WER,在说话人分离任务上 6% WDER,句号 43% SER、逗号 52% SER、问号 43% SER、大小写 30% SER。我们的识别器配有一个利用识别器声学与词汇特征的置信度模型,该模型约 0.37 NCE。最后,我们描述了一种基于 RNN-T 的标注模型。模型性能依赖于本体,药物 F 值 0.90、症状 0.76、病情 0.75、诊断 0.76、治疗 0.61。尽管仍有改进空间,我们的结果表明这些模型对实际应用已足够准确。

关键词

引用

@article{arxiv.2104.02219,
  title  = {Understanding Medical Conversations: Rich Transcription, Confidence Scores & Information Extraction},
  author = {Hagen Soltau and Mingqiu Wang and Izhak Shafran and Laurent El Shafey},
  journal= {arXiv preprint arXiv:2104.02219},
  year   = {2021}
}