ET-SAM:用于统一场景文本检测和布局分析的高效点提示预测
计算机视觉与模式识别
2026-03-27 v1
摘要
基于 Segment Anything Model (SAM) 的现有工作在统一场景文本检测和布局分析方面取得了令人满意的性能。然而,通常依赖像素级文本分割来对采样数千个前景点作为提示,导致推理延迟不达标和数据利用率受限。为解决上述问题,我们提出了 ET-SAM,一个基于 SAM 的用于统一场景文本检测和布局分析的高效框架,包含两个解码器。技术上,我们定制了一个轻量级点解码器,用于生成单词热力图,从而实现少量前景点,消除过多的点提示并加速推理。无需依赖像素级分割,我们进一步设计了联合训练策略,以利用带有异构文本级别注释的数据。具体而言,将多级别、单词级别仅、和行级别仅注释的数据集并行组合为统一训练集。对于这些数据集,我们在点解码器和层次化掩码解码器中引入三个对应的可学习任务提示,以缓解跨数据集的差异。大量实验表明,与之前的 SAM-based 架构相比,ET-SAM 在 HierText 上实现了约 3 倍的推理加速,同时在 Total-Text、CTW1500 和 ICDAR15 上 F 分数平均提升了 11.0%。
引用
@article{arxiv.2603.25168,
title = {ET-SAM: Efficient Point Prompt Prediction in SAM for Unified Scene Text Detection and Layout Analysis},
author = {Xike Zhang and Maoyuan Ye and Juhua Liu and Bo Du},
journal= {arXiv preprint arXiv:2603.25168},
year = {2026}
}
备注
20 pages, 8 figures, 8 tables. Submitted to ECCV 2026