Hi-GaTA:面向手术视频报告生成的层次化门控时序聚合适配器
计算机视觉与模式识别
2026-05-19 v2
摘要
自动化、临床水平的手术程序评估报告可减少文档负担并提供客观反馈,但由于难以将稠密时空视频表示与基于语言的推理对齐,以及缺乏高质量、隐私保护的数据集,这一任务仍具挑战性。为此,我们构建了一个包含 214 个高质量模拟手术视频及其由外科医生撰写的评估报告的基准数据集。基于此资源,我们提出了一种面向手术视频报告生成的感知-对齐-推理框架,其中包含 Hi-GaTA——一种新型轻量级时序适配器,通过从短程到长程的时序聚合,高效地将长视频序列压缩为紧凑、与大语言模型兼容的视觉前缀标记。为实现稳健的视觉感知,我们在 40,000 分钟公共手术视频上对 Sur40k(一种针对手术场景的 ViViT 风格视频编码器)进行预训练,以捕获细粒度时空程序先验。Hi-GaTA 采用文本条件的双交叉注意力时序金字塔结构,并通过跨层门控融合和递增深度策略来提高多尺度一致性。最后,我们使用 LoRA 对大语言模型主干进行微调,以实现在有限监督下的连贯且风格一致的手术报告生成。实验表明,我们的方法在整体性能上取得最佳结果,相较于强大的多模态大语言模型(MLLM)基线 consistently 获得提升。消融研究进一步验证了每个提议组件的有效性。
引用
@article{arxiv.2605.11208,
title = {Hi-GaTA: Hierarchical Gated Temporal Aggregation Adapter for Surgical Video Report Generation},
author = {Kedi Sun and Chaohui Dang and Yue Feng and James Glasbey and Theodoros N. Arvanitis and Le Zhang},
journal= {arXiv preprint arXiv:2605.11208},
year = {2026}
}
备注
11 pages, 2 figures