MedHorizon:迈向野外长上下文医疗视频理解
计算机视觉与模式识别
2026-05-08 v1
摘要
医疗多模态大语言模型(MLLMs)在图像理解和短视频分析方面取得了进展,但真实的临床审查通常需要全流程视频理解。与一般长视频不同,医疗过程包含高度冗余的解剖视图,而决定性证据在时间上稀疏、空间上细微且依赖于上下文。现有基准通常假设这些证据已通过图像、短片段或预分割视频定位,使得“推理前检索”问题未被充分测试。我们引入了MedHorizon,一个用于长上下文医疗视频理解的野外基准。MedHorizon保留了759小时的全长临床过程,并提供了1,253个基于证据的多项选择题,共同评估稀疏证据理解和多跳临床推理。其证据极其稀疏,平均仅有0.166%的证据帧,要求模型在解释和聚合发现之前搜索嘈杂的过程流。我们评估了代表性的通用领域、医疗领域和长视频MLLMs。最佳模型仅达到41.1%的准确率,表明当前系统距离稳健的全流程理解仍有很大差距。进一步分析得出四个关键发现:性能并未随帧数增加而可靠地提升;证据检索和临床解释仍是主要瓶颈;这些瓶颈根源于冗余下薄弱的过程推理和注意力漂移;通用采样方法仅能部分平衡局部细节与全局覆盖。MedHorizon为检索稀疏证据并在完整临床工作流上进行推理的MLLMs提供了严格的测试平台。
引用
@article{arxiv.2605.06537,
title = {MedHorizon: Towards Long-context Medical Video Understanding in the Wild},
author = {Bodong Du and Bowen Liu and Yang Yu and Xinpeng Ding and Zhiheng Wu and Shuning Wang and Shuo Nie and Naiming Liu and Qifeng Chen and Yangqiu Song and Xiaomeng Li},
journal= {arXiv preprint arXiv:2605.06537},
year = {2026}
}