中文

基于多智能体大语言模型的外科反馈质量评分框架

计算与语言 2026-05-26 v1 人工智能 多智能体系统

摘要

在手术操作室中,随身围观的外科医生所提供的口头反馈在住院医师技能培养中发挥着关键的形成性作用。然而,评估教练反馈质量及其在现场手术中对影响住院医师行为的效果,仍面临挑战。以往研究依赖于专家人工评估者进行大量手动标注,仅关注开发广泛的分类法,忽略了反馈传递的定性方面,如清晰度或紧迫性。现有有限的自动化方法,包括关键词分析和主题建模,也无法捕捉这些细微方面。我们引入一个基于大语言模型的两阶段框架,通过发现以外科训练语境为基础的可解释反馈质量准则。该方法使用多智能体提示和外科领域知识注入,以发现一小组人类可解释的评分准则(例如:鼓励的、紧急的、清晰的)。这些准则随后用于通过大语言模型作为评判官的方式自动评分现场手术反馈。针对4200多条教练反馈实例的评估显示,我们的人工智能发现的准则在预测反馈效果方面优于先前基于内容的框架,包括观察到的住院医师行为调整和教练批准。该工作推动了操作室沟通质量的可扩展、人类对齐评估,并为改进外科教学实践奠定了基础。

关键词

引用

@article{arxiv.2605.25440,
  title  = {A Multi-Agent LLM Framework for Rating the Quality of Surgical Feedback},
  author = {Rafal Kocielnik and J. Everett Knudsen and Steven Y. Cen and Jasmine Lin and Cherine H. Yang and Atharva Deo and Ujjwal Pasupulety and Peter Wager and Anima Anandkumar and Andrew J. Hung},
  journal= {arXiv preprint arXiv:2605.25440},
  year   = {2026}
}

备注

25 pages, 3 figures