使用 Seq2Seq 模型校正临床对话转写错误
计算与语言
2022-05-30 v1 人工智能
摘要
良好沟通对优质医疗至关重要。临床对话是医疗从业者与患者之间为获取和共享医疗信息而进行的交流。这些信息有助于对患者的医疗决策,并在其就医过程中起关键作用。对笔记记录和手工抄写流程的依赖极低效,且在数字化笔记时导致手工转写错误。自动语音识别(ASR)在语音转文本应用中作用重大,并可直接用作对话应用中的文本生成器。然而,记录临床对话带来诸多通用与领域特有挑战。本文提出一种用于临床对话 ASR 转写错误校正的 seq2seq 学习方法。我们引入一个新的胃肠道临床对话(Gastrointestinal Clinical Dialogue, GCD)数据集,由医疗专业人员从英国国家医疗服务体系(NHS)炎症性肠病诊所收集,并将其与四个商业 ASR 系统进行对比研究。利用自监督策略,我们在领域特定的 PubMed 数据集上以掩码填充任务微调 seq2seq 模型,该数据集已公开以供后续研究。经掩码填充微调的 BART 模型能够校正转写错误,并在四个商业 ASR 输出中的三个上取得更低词错误率。
引用
@article{arxiv.2205.13572,
title = {Clinical Dialogue Transcription Error Correction using Seq2Seq Models},
author = {Gayani Nanayakkara and Nirmalie Wiratunga and David Corsar and Kyle Martin and Anjana Wijekoon},
journal= {arXiv preprint arXiv:2205.13572},
year = {2022}
}
备注
Pre-print of the paper accepted at the 6th International Workshop on Health Intelligence (W3PHIAI-22)