中文

用于多模态患者数据控制的语音交互外科智能体

计算与语言 2025-12-19 v3 人工智能

摘要

在机器人外科手术中,外科医生完全专注于手术操作,使其难以在不中断程序的情况下访问和操作多模态患者数据。为克服这一问题,我们提出了一个基于分层多智能体框架的语音交互外科智能体(VISA),该框架由一个编排智能体和三个任务特定智能体组成,这些由大型语言模型(LLM)驱动的智能体负责检索临床信息、操作 CT 扫描或在手术视频中导航 3D 解剖模型。我们构建了一个包含 240 个用户命令的 数据集,组织为分层类别,并引入了多级编排评估指标(MOEM),在命令和类别水平上评估性能和鲁棒性。实验结果表明,VISA 在阶段级准确率和工作流程级成功率方面表现出色,同时通过纠正转录错误、解决语言歧义和解释多样化的自由形式表达来提高鲁棒性。这些发现突显了 VISA 支持机器人外科手术的强大潜力,以及其扩展性以集成新的功能和智能体。

关键词

引用

@article{arxiv.2511.07392,
  title  = {Voice-Interactive Surgical Agent for Multimodal Patient Data Control},
  author = {Hyeryun Park and Byung Mo Gu and Jun Hee Lee and Byeong Hyeon Choi and Sekeun Kim and Hyun Koo Kim and Kyungsang Kim},
  journal= {arXiv preprint arXiv:2511.07392},
  year   = {2025}
}

备注

14 pages, 13 figures, 3 tables