中文

面向临床技能视频的连续交互程序正确性评估基准:SiMing-Bench

计算机视觉与模式识别 2026-04-13 v1 计算与语言 人机交互

摘要

当前的视频基准测试针对多模态大语言模型 (MLLM) 关注事件识别、时间顺序和长程记忆,却忽视了专家程序判断所需的更具挑战性的能力:跟踪ongoing interactions如何更新程序状态,从而确定后续动作的正确性。我们提出SiMing-Bench,第一个针对完整临床技能视频进行此类评估的基准测试。它针对以 rubric 为依据的过程级判断,评估interaction驱动的状态更新是否在整个工作流程中保持程序正确性。SiMing-Bench基于医生标注的真实临床技能检查视频数据集,涵盖心肺复苏、自动外除颤器操作和气体面罩通气,每个视频配有标准化的分步 rubric 和双专家标签。在多样化的开源和闭源 MLLM 上,我们观察到其与医生判断一致性较弱。此外,即使在整体程序级相关性看起来可接受的情况下,针对 rubric 定义的中间步骤的表现仍然较差,这表明粗糙的全局评估显著高估了当前模型的程序判断能力。额外的分析表明,二元步骤判断和步骤对齐剪辑的表现不佳,表明瓶颈不仅仅是细粒度评分或时间局部分析,而是建模连续interaction如何随时间更新程序状态。

关键词

引用

@article{arxiv.2604.09037,
  title  = {SiMing-Bench: Evaluating Procedural Correctness from Continuous Interactions in Clinical Skill Videos},
  author = {Xiyang Huang and Jiawei Lin and Keying Wu and Jiaxin Huang and Kailai Yang and Renxiong Wei and Cheng zeng and Jiayi Xiang and Ziyan Kuang and Min Peng and Qianqian Xie and Sophia Ananiadou},
  journal= {arXiv preprint arXiv:2604.09037},
  year   = {2026}
}