利用视觉-语言预训练模型提升医疗语音转文字准确率
音频与语音处理
2023-03-02 v1 人工智能
计算与语言
计算机视觉与模式识别
声音
图像与视频处理
摘要
自动语音识别(ASR)是一种将口语转换为文本的技术,促进人与机器间的交互。ASR 最常见的应用之一是语音转文字(STT)技术,其通过将口语转写为文本来简化用户工作流。在医疗领域,STT 有潜力显著减少依赖打字员转写其语音记录的临床医生的工作负担。然而,由于缺少充足的语音与文本数据集,开发医疗领域的 STT 模型具有挑战性。为解决此问题,我们提出一种医疗领域文本纠错方法,利用视觉-语言预训练(VLP)方法对通用 STT 系统的输出文本进行修改。VLP 结合文本与视觉信息,基于图像知识纠正文本。我们大量实验表明,所提方法在医疗领域 STT 性能上带来了量化上和临床意义上的显著改进。我们进一步表明,图像与文本信息的多模态理解优于仅用文本信息的单模态理解。
引用
@article{arxiv.2303.00091,
title = {Improving Medical Speech-to-Text Accuracy with Vision-Language Pre-training Model},
author = {Jaeyoung Huh and Sangjoon Park and Jeong Eun Lee and Jong Chul Ye},
journal= {arXiv preprint arXiv:2303.00091},
year = {2023}
}