中文

面向术前语音助手的智能决策:基于手术工作流程分析的多模态模型

统计力学 2024-06-24 v1

摘要

为了开发智能语音助手并将其无缝集成到术前决策支持框架中,准确且高效的手术阶段识别是必备条件。本研究提出一种基于门控多模态单元(Gated Multimodal Units, GMU)和多阶段时序卷积网络(Multi-Stage Temporal Convolutional Networks, MS-TCN)的多模态框架,用于识别导管置入手术的手术阶段。该方法融合语音和图像模型,并在不同手术阶段中分别使用它们。基于对28例手术的评估,我们报告了帧级准确率为92.65 \pm 3.52%,F1分数为92.30 \pm 3.82%。我们的结果显示在两个指标上都有约10%的改进,验证了集成多模态数据进行手术阶段识别任务的有效性。我们进一步通过比较单模态模型和多模态模型来探讨各个数据通道的贡献。

关键词

引用

@article{arxiv.2406.14575,
  title  = {Theory of Turbulence for $d \rightarrow \infty$: Four-Loop Approximation of the Renormalization Group},
  author = {Loran Ts. Adzhemyan and Yury Kirienko},
  journal= {arXiv preprint arXiv:2406.14575},
  year   = {2024}
}

备注

13 pages