中文

利用视觉-语言预训练模型提升医疗语音转文字准确率

音频与语音处理 2023-03-02 v1 人工智能 计算与语言 计算机视觉与模式识别 声音 图像与视频处理

摘要

自动语音识别(ASR)是一种将口语转换为文本的技术,促进人与机器间的交互。ASR 最常见的应用之一是语音转文字(STT)技术,其通过将口语转写为文本来简化用户工作流。在医疗领域,STT 有潜力显著减少依赖打字员转写其语音记录的临床医生的工作负担。然而,由于缺少充足的语音与文本数据集,开发医疗领域的 STT 模型具有挑战性。为解决此问题,我们提出一种医疗领域文本纠错方法,利用视觉-语言预训练(VLP)方法对通用 STT 系统的输出文本进行修改。VLP 结合文本与视觉信息,基于图像知识纠正文本。我们大量实验表明,所提方法在医疗领域 STT 性能上带来了量化上和临床意义上的显著改进。我们进一步表明,图像与文本信息的多模态理解优于仅用文本信息的单模态理解。

关键词

引用

@article{arxiv.2303.00091,
  title  = {Improving Medical Speech-to-Text Accuracy with Vision-Language Pre-training Model},
  author = {Jaeyoung Huh and Sangjoon Park and Jeong Eun Lee and Jong Chul Ye},
  journal= {arXiv preprint arXiv:2303.00091},
  year   = {2023}
}