多层语义场景理解的层次上下文转换器
计算机视觉与模式识别
2025-02-24 v1
摘要
对手术场景进行全面且明确的理解,对于开发操作室中的上下文感知计算机辅助系统至关重要。然而,少数工作为实现层次化手术场景理解提供了系统化的分析。本文提出将任务集合 [阶段识别 --> 步骤识别 --> 动作和仪器检测] 表示为多层语义场景理解(Multi-level Semantic Scene Understanding, MSSU)。为此目标,我们提出了一种新型层次上下文转换器(Hierarchical Context Transformer, HCT)网络,并深入探讨了不同层级任务之间的关系。具体而言,设计了一个层次关系聚合模块(Hierarchical Relation Aggregation Module, HRAM),用于同时关联多层交互信息中的条目,然后增强任务特定的特征。为进一步提升不同任务的特征表示学习,提出了跨任务对比学习(Inter-task Contrastive Learning, ICL),以引导模型通过吸收其他任务的互补信息来学习任务级特征。此外,考虑到转换器的计算成本,我们提出了 HCT+ 以整合空间和时间适配器,以在显著减少可调参数数量的同时获得竞争性能。在我们的白内障数据集和公开的内窥 PSI-AVA 数据集上进行大量实验,结果表明本方法始终显著超过了最先进的方法。代码已公开于 https://github.com/Aurora-hao/HCT。
引用
@article{arxiv.2502.15184,
title = {Hierarchical Context Transformer for Multi-level Semantic Scene Understanding},
author = {Luoying Hao and Yan Hu and Yang Yue and Li Wu and Huazhu Fu and Jinming Duan and Jiang Liu},
journal= {arXiv preprint arXiv:2502.15184},
year = {2025}
}
备注
This paper has been accepted by the IEEE TCSVT