一种用于中文医疗标点恢复的小型快速 BERT 模型
计算与语言
2024-07-01 v4
摘要
在临床口述记录中,经过自动语音识别(ASR)且不含显式标点的话语可能导致对口述报告的误解。为借助 ASR 生成精确且易懂的临床报告,需要进行自动标点恢复。考虑到实际场景,我们基于“预训练与微调”范式提出了一种用于中文医疗标点恢复的快速轻量预训练模型。本工作中,我们通过结合有监督对比学习和一种新颖的辅助预训练任务(标点预测)来蒸馏预训练模型,使其更适用于标点恢复。我们在多种蒸馏模型上的实验表明,相对于最先进的中文 RoBERTa,我们的模型在模型规模仅为 10% 的情况下可达到 95% 的性能。
引用
@article{arxiv.2308.12568,
title = {A Small and Fast BERT for Chinese Medical Punctuation Restoration},
author = {Tongtao Ling and Yutao Lai and Lei Chen and Shilei Huang and Yi Liu},
journal= {arXiv preprint arXiv:2308.12568},
year = {2024}
}
备注
5 pages, 2 figures, Accepted by INTERSPEECH 2024