中文

用于手术反馈分类的深度多模态融合

机器学习 2023-12-07 v1 人工智能 计算机视觉与模式识别 人机交互 音频与语音处理

摘要

量化经验丰富的外科医生在手术过程中向受训者提供的实时非正式反馈对于提高手术培训技能至关重要。这种在实时手术室中的反馈本质上是多模态的,包括口头对话(例如问答)以及非语言元素(例如通过指向解剖结构等视觉线索)。在这项工作中,我们利用了一种经过临床验证的五类手术反馈分类:“解剖”、“技术”、“程序”、“表扬”和“视觉辅助”。然后,我们开发了一个多标签机器学习模型,从文本、音频和视频模态的输入中对这五类手术反馈进行分类。我们工作的最终目标是帮助大规模自动化实时情境化手术反馈的标注。我们的手术反馈自动分类实现了71.5至77.6的AUC,融合使性能提高了3.1%。我们还表明,来自专家的人工高质量反馈音频转录将AUC提高到76.5至96.2之间,这为未来的改进指明了清晰的方向。根据经验,我们发现分阶段训练策略(先分别预训练每种模态,然后联合训练)比同时训练不同模态更有效。我们还提出了关于不同反馈类别中模态重要性的直观发现。这项工作首次深入探讨了基于文本、音频和视频模态对真实世界实时手术反馈进行自动分类的可行性。

关键词

引用

@article{arxiv.2312.03231,
  title  = {Deep Multimodal Fusion for Surgical Feedback Classification},
  author = {Rafal Kocielnik and Elyssa Y. Wong and Timothy N. Chu and Lydia Lin and De-An Huang and Jiayun Wang and Anima Anandkumar and Andrew J. Hung},
  journal= {arXiv preprint arXiv:2312.03231},
  year   = {2023}
}