SAM3-LiteText:面向高效视觉语言分割的文本编码器解剖学研究
人工智能
2026-02-13 v1
摘要
视觉语言分割模型如 SAM3 能够实现灵活的、提示驱动的视觉 grounding,但继承了原为开放式语言理解而设计的大型通用文本编码器。在实际应用中,分割提示短小、结构化且语义受限,导致文本编码器容量严重过度配置,伴随显著的计算和内存开销。本文对视觉语言分割中的文本提示进行大规模解剖分析,覆盖 404,796 条真实提示及多个基准。我们的分析揭示严重的冗余:大多数上下文窗口未得到充分利用,词汇使用高度稀疏,文本嵌入虽然是高维表示,却位于低维流形上。基于此,我们提出 SAM3-LiteText,一种轻量级文本编码框架,用经知识蒸馈优化的紧凑 MobileCLIP 学生取代原 SAM3 文本编码器。广泛实验表明,SAM3-LiteText 将文本编码器参数降低最高 88%,显著降低静态内存占用,同时在分割性能上与原模型相当。代码:https://github.com/SimonZeng7108/efficientsam3/tree/sam3_litetext
关键词
引用
@article{arxiv.2602.12173,
title = {SAM3-LiteText: An Anatomical Study of the SAM3 Text Encoder for Efficient Vision-Language Segmentation},
author = {Chengxi Zeng and Yuxuan Jiang and Ge Gao and Shuai Wang and Duolikun Danier and Bin Zhu and Stevan Rudinac and David Bull and Fan Zhang},
journal= {arXiv preprint arXiv:2602.12173},
year = {2026}
}