PTM:用于图像和视频分割的纯文本掩码变换器,支持冻结视觉编码器
计算机视觉与模式识别
2026-03-27 v1
摘要
大规模预训练的视觉基础模型(VFMs)使得单个冻结编码器能够同时服务于多个下游任务。近期基于 VFM 的编码器-only 模型,如 EoMT 和 VidEoMT,在实现竞争精度的同时展现出极低的延迟,但需要对编码器进行微调,牺牲了 VFMs 在实际中可部署性的吸引力——即多任务编码器共享。为协调编码器-only 的简单性和速度与冻结 VFM 特征,本文提出纯文本掩码解码器(Plain Mask Decoder, PMD),这是一种基于变换器的快速分割解码器, operates on top of frozen VFM features. 最终得到的模型为纯文本掩码变换器(Plain Mask Transformer, PMT),它保留了编码器-only 设计的架构简单性和低延迟,同时保持编码器表示不变且可共享。该设计无缝适用于图像和视频分割,继承了编码器-only 框架的通用性。在标准图像分割基准测试中,PMT 在保持冻结编码器最先进水平的同时,速度提升约3倍。对于视频分割,即使在完全微调方法上与之持平,又比现有冻结编码器最先进模型快达8倍。代码:https://github.com/tue-mps/pmt。
引用
@article{arxiv.2603.25398,
title = {PMT: Plain Mask Transformer for Image and Video Segmentation with Frozen Vision Encoders},
author = {Niccolò Cavagnero and Narges Norouzi and Gijs Dubbelman and Daan de Geus},
journal= {arXiv preprint arXiv:2603.25398},
year = {2026}
}
备注
8 pages, ECV 2026, CVPR Workshop