SwinDocSegmenter:一种用于文档实例分割的端到端统一域自适应 Transformer
计算机视觉与模式识别
2023-09-12 v1 机器学习
摘要
文档的实例级分割在于为图像的每个像素分配一个类别感知且实例感知的标签。它是文档解析以理解文档的关键步骤。在本文中,我们提出了一种统一的 transformer 编码器-解码器架构,用于文档图像中复杂版式的端到端实例分割。该方法在解码器中采用对比训练与混合查询选择进行锚点初始化。随后,它将所获得的查询嵌入与像素嵌入图(来自编码器)进行点积以进行语义推理。在 PubLayNet、PRIMA、Historical Japanese (HJ) 和 TableBank 等竞争性基准上的大量实验表明,我们基于 SwinL 骨干网络的模型在十亿参数以内分别以平均精度 \textbf{93.72}、\textbf{54.39}、\textbf{84.65} 和 \textbf{98.04} 取得了优于现有 SOTA 方法的分割性能。代码已公开于:\href{https://github.com/ayanban011/SwinDocSegmenter}{github.com/ayanban011/SwinDocSegmenter}
引用
@article{arxiv.2305.04609,
title = {SwinDocSegmenter: An End-to-End Unified Domain Adaptive Transformer for Document Instance Segmentation},
author = {Ayan Banerjee and Sanket Biswas and Josep Lladós and Umapada Pal},
journal= {arXiv preprint arXiv:2305.04609},
year = {2023}
}
备注
Accepted to ICDAR 2023 (San Jose, California)