Hi-SAM:结合分割一切模型实现层次化文本分割
计算机视觉与模式识别
2024-11-11 v2
摘要
分割一切模型(SAM)是一个在大规模数据集上预训练的深度视觉基础模型,它打破了通用分割的界限,催生了各种下游应用。本文介绍了Hi-SAM,一个利用SAM进行层次化文本分割的统一模型。Hi-SAM擅长在四个层次上进行分割,包括像素级文本、单词、文本行和段落,同时还能实现版面分析。具体来说,我们首先通过参数高效微调方法将SAM转变为高质量的像素级文本分割(TS)模型。我们使用该TS模型以半自动方式迭代生成像素级文本标签,统一了HierText数据集中四个文本层次的标签。随后,利用这些完整的标签,我们基于TS架构推出了端到端可训练的Hi-SAM,并配备了一个定制的层次化掩码解码器。在推理过程中,Hi-SAM提供自动掩码生成(AMG)模式和可提示分割(PS)模式。在AMG模式下,Hi-SAM首先分割像素级文本前景掩码,然后采样前景点以生成层次化文本掩码,并顺带实现布局分析。至于PS模式,Hi-SAM通过单次点击即可提供单词、文本行和段落掩码。实验结果表明,我们的TS模型达到了最先进的性能:在Total-Text上像素级文本分割的fgIOU为84.86%,在TextSeg上为88.96%。此外,与之前在HierText上进行联合层次化检测和布局分析的专用模型相比,Hi-SAM取得了显著改进:在文本行级别上,PQ提升4.73%,F1提升5.39%;在段落级别布局分析上,PQ提升5.49%,F1提升7.39%,且所需的训练轮次减少了20倍。代码可在https://github.com/ymy-k/Hi-SAM获取。
引用
@article{arxiv.2401.17904,
title = {Hi-SAM: Marrying Segment Anything Model for Hierarchical Text Segmentation},
author = {Maoyuan Ye and Jing Zhang and Juhua Liu and Chenyu Liu and Baocai Yin and Cong Liu and Bo Du and Dacheng Tao},
journal= {arXiv preprint arXiv:2401.17904},
year = {2024}
}
备注
Accepted by IEEE TPAMI. GitHub repository: https://github.com/ymy-k/Hi-SAM