中文

PharmaShip:面向中文药品运输文档的以实体为中心且受阅读顺序监督的基准

计算与语言 2026-01-01 v1

摘要

我们提出了 PharmaShip,一个真实世界的中文扫描药品运输文档数据集,旨在压力测试预训练文本版面模型在噪声 OCR 和异构模板下的表现。PharmaShip 涵盖三个互补任务——序列实体识别(SER)、关系抽取(RE)和阅读顺序预测(ROP),并采用以实体为中心的评估协议,以最大程度减少不同架构间的混淆变量。我们对涵盖像素感知和几何感知系列的五个代表性基线(LiLT、LayoutLMv3-base、GeoLayoutLM 及其可用的 RORE 增强变体)进行了基准测试,并统一了预处理、数据集划分和优化过程。实验表明,像素和显式几何提供了互补的归纳偏置,但单独使用任一都不充分:注入面向阅读顺序的正则化持续改进了 SER 和 EL,并产生了最稳健的配置,而更长的位置覆盖范围则稳定了后页预测并减少了截断伪影。ROP 在词级别是准确的,但在片段级别具有挑战性,这反映了边界模糊和长距离交叉。因此,PharmaShip 为制药领域安全关键的文档理解建立了一个可控、可复现的基准,并突显了序列感知约束作为结构建模的可迁移偏置。我们在 https://github.com/KevinYuLei/PharmaShip 上发布了该数据集。

关键词

引用

@article{arxiv.2512.23714,
  title  = {PharmaShip: An Entity-Centric, Reading-Order-Supervised Benchmark for Chinese Pharmaceutical Shipping Documents},
  author = {Tingwei Xie and Tianyi Zhou and Yonghong Song},
  journal= {arXiv preprint arXiv:2512.23714},
  year   = {2026}
}

备注

5 pages, 4 figures