生成自然语言外科反馈:从结构化表示到领域约束评估
计算机视觉与模式识别
2025-11-20 v1 人工智能
计算与语言
机器学习
摘要
高质量的手术期间反馈对于提高学员表现和长期技能习得至关重要。自动化的、类似教练的自然语言反馈虽然能提供及时、可访问且一致的指导,但要求模型理解临床相关的表示。我们提出了结构感知管道,从真实的教练-学员 transcript(33例手术)中学习外科动作本体,并用于约束反馈生成。我们的工作贡献包括:(1)从真实世界的反馈文本中挖掘 Instrument-Action-Target(IAT)三元组并聚类表面形式为标准化类别;(2)微调视频到 IAT 的模型,利用手术程序和任务上下文以及细粒度的仪器运动;(3)演示如何有效地使用 IAT 三元组表示来指导 GPT-4o 生成临床依据的、教练风格的反馈。在任务 1:视频到 IAT 识别上,我们的上下文注入和时间跟踪为一致的 AUC 带来提升(仪器:0.67→0.74;动作:0.60→0.63;组织:0.74→0.79)。对于任务 2:反馈文本生成(基于 1-5 的忠实度评估标准,其中 1=相反/不安全,3=可接受,5=完全符合人类教练),GPT-4o仅凭视频得分 2.17,而 IAT 条件化得分提升至 2.44(+12.4%),可接受生成(得分≥3)的比例从 21% 翻倍至 42%。传统文本相似度指标也得到改善:词错误率降低 15-31%,ROUGE(词/子串重合)提升 9-64%。基于显式 IAT 结构的生成在忠实度和可验证性方面均取得优势,支持外科训练中的可审计应用。
引用
@article{arxiv.2511.15159,
title = {Generating Natural-Language Surgical Feedback: From Structured Representation to Domain-Grounded Evaluation},
author = {Firdavs Nasriddinov and Rafal Kocielnik and Anima Anandkumar and Andrew J. Hung},
journal= {arXiv preprint arXiv:2511.15159},
year = {2025}
}
备注
Accepted as proceedings paper for ML4H 2025