VISTA:基于验证引导的空间与时序基础模型集成及解剖解码用于罕见病理VCE事件检测
计算机视觉与模式识别
2026-03-20 v1
摘要
胶囊内镜事件检测因诊断相关发现稀疏、视觉异质且嵌入长时序噪声视频流中,而评估仅按事件层级进行(而非仅靠帧准确率),因此将罕见病理VISION任务(RARE-VISION)构建为指标对齐的事件检测问题,而非纯粹的帧级分类任务。我们的框架组合两个互补的主干网络:EndoFM-LV用于局部时序上下文,DINOv3 ViT-L/16用于强帧级视觉语义,随后经过多样化头集合、验证引导的层次化融合与解剖感知时序事件解码。融合阶段采用验证数据中的类别级模型加权、主干网络加权与概率校准;解码阶段应用时序平滑、解剖约束、阈值细化与逐标签事件生成,以产出稳定的事件预测。验证消融实验表明,互补主干网络、验证引导融合与解剖感知时序解码均对事件级性能贡献突出。在官方隐藏测试集上,本方法实现了总体时序[email protected]为0.3530,时序[email protected]为0.3235。
关键词
引用
@article{arxiv.2603.18343,
title = {VISTA: Validation-Guided Integration of Spatial and Temporal Foundation Models with Anatomical Decoding for Rare-Pathology VCE Event Detection},
author = {Bo-Cheng Qiu and Yu-Fan Lin and Yu-Zhe Pien and Chia-Ming Lee and Fu-En Yang and Yu-Chiang Frank Wang and Chih-Chung Hsu},
journal= {arXiv preprint arXiv:2603.18343},
year = {2026}
}