PoCaP 语料库:基于介入放射学工作流分析的智能手术室语音助手多模态数据集
声音
2022-06-27 v1 人工智能
音频与语音处理
摘要
本文提出一个新的多模态介入放射学数据集,称为 PoCaP(Port Catheter Placement)语料库。该语料库由德语语音与音频信号、X 射线图像以及系统指令组成,采集自 31 例 PoCaP 介入手术,由六名外科医生完成,平均时长为 81.4 41.0 分钟。该语料库旨在为开发手术室智能语音助手提供资源。特别地,它可用于开发语音控制系统,使外科医生能够控制 C 臂运动和手术台位置等操作参数。为记录该数据集,我们获得了埃尔朗根大学医院机构审查委员会与职工委员会以及患者对于数据隐私的同意。我们描述了录制设置、数据结构、工作流与预处理步骤,并报告了首次 PoCaP 语料库语音识别分析结果:使用预训练模型取得了 11.52 的词错误率。研究结果表明,该数据有潜力构建鲁棒的指令识别系统,并将推动医学领域中利用语音与图像处理的新型介入支持系统的发展。
引用
@article{arxiv.2206.12320,
title = {PoCaP Corpus: A Multimodal Dataset for Smart Operating Room Speech Assistant using Interventional Radiology Workflow Analysis},
author = {Kubilay Can Demir and Matthias May and Axel Schmid and Michael Uder and Katharina Breininger and Tobias Weise and Andreas Maier and Seung Hee Yang},
journal= {arXiv preprint arXiv:2206.12320},
year = {2022}
}
备注
8 pages, 4 figures, Text, Speech and Dialogue 2022 Conference