聚焦-感知表示学习:用于内窥镜视频分析的认知启发式层次化框架
计算机视觉与模式识别
2026-03-30 v1
摘要
内窥镜视频分析对于早期胃肠道筛查至关重要,但仍然受到高质量标注数据有限的制约。虽然自监督视频预训练显示出前景,但现有针对自然视频开发的方法优先考虑密集的时空建模并表现出运动偏差,忽视了临床决策所依赖的静态、结构化语义。为应对这一挑战,我们提出了聚焦-感知表示学习(FPRL),一种认知启发的层次化框架,模拟临床检查过程。FPRL首先聚焦于帧内病变中心区域以学习静态语义,然后感知它们在帧间的演化以建模上下文语义。为此,FPRL采用了一种层次化语义建模机制,明确区分并协同学习这两种语义。具体而言,它首先通过教师先验自适应掩码(TPAM)结合多视角稀疏采样来捕获静态语义。该方法减少了冗余的时间依赖关系,使模型能够集中于病变相关的局部语义。随后,通过跨视角掩码特征补全(CVMFC)和注意力引导的时间预测(AGTP)推导出上下文语义。这些过程建立了跨视角的对应关系,并有效地建模了结构化的帧间演化,从而在保持全局上下文完整性的同时强化了时间语义连续性。在11个内窥镜视频数据集上的广泛实验表明,FPRL在多样化的下游任务中取得了优越性能,证明了其在内窥镜视频表示学习中的有效性。代码可在 https://github.com/MLMIP/FPRL 获取。
引用
@article{arxiv.2603.25778,
title = {Focus-to-Perceive Representation Learning: A Cognition-Inspired Hierarchical Framework for Endoscopic Video Analysis},
author = {Yuan Zhang and Sihao Dou and Kai Hu and Shuhua Deng and Chunhong Cao and Fen Xiao and Xieping Gao},
journal= {arXiv preprint arXiv:2603.25778},
year = {2026}
}
备注
Accepted to CVPR 2026