中文

基于解剖学引导的视觉-语言学习:多标签视频胃镜分类下的角度原型分离

计算机视觉与模式识别 2026-05-25 v2 人工智能

摘要

本工作提出了一个用于视频胃镜 (VCE) 的多标签时间事件检测框架,旨在解决Galar 数据集中极端类别不平衡的问题,通过两种主要贡献的结合:在类别原型上的角度分离损失和生物学状态机时间解码器。 backbone 仍为 BiomedCLIP,一种生物医学视觉-语言基础模型。通过 Local Differencing Attention 模块将三个连续帧融合,以通过抑制静态时间冗余来放大瞬时病理信号。Anatomy Context Head 则将病理预测置于软解剖激活上,利用已知的 GI 病 findings 的空间共现结构。通过在可学习的文本-特征提示和基于原型的 logit 增强旁训练,以及一个惩罚类别原型之间 off-diagonal 余弦相似性的角度分离损失,以防止在极端不平衡下稀有类的原型坍塌。为抵消标签分布偏斜,训练方案结合了 asymmetric focal loss、逆频率加权抽样、temporal Mixup、Exponential Moving Average 和 per-class threshold 校准。生物学状态机解码器取代了 naive gap 合并,采用基于解剖学标签的 physiologically grounded 前向-only 状态转换,消除了在先前方法中产生的每段视频数百个虚构解剖事件的碎片化痕迹,将每个视频的解剖输出减少到2--3个临床上真实的事件。在 held-out RARE-VISION 测试集(包含161,025帧的三项 NaviCam 检查)上,更新的 pipeline 在整体 temporal [email protected] 上达到 0.3597,在 [email protected] 上达到 0.3399,分别相对于 prior submission 实现了约46% 和44% 的相对改进,总体推理仅需约21分钟即可在单个 GPU 上完成。

关键词

引用

@article{arxiv.2603.17879,
  title  = {Anatomy-Guided Vision-Language Learning with Angular Prototype Separation for Multi-Label Video Capsule Endoscopy Classification Under Class Imbalance},
  author = {Podakanti Satyajith Chary and Nagarajan Ganapathy},
  journal= {arXiv preprint arXiv:2603.17879},
  year   = {2026}
}

备注

12 pages, 1 figure, ICPR 2026 RARE-VISION Competition