中文

面向 Khmer 场景文档布局检测的探索

计算机视觉与模式识别 2026-03-03 v1

摘要

尽管拉丁脚本文档布局分析取得了显著进展,推动了大型多模态模型 (LMM) 的应用,但就 Khmer 语言而言,仍面临数据标注稀缺的限制。这一差距在场景文档中尤为突出,因为视角畸变和复杂背景挑战了传统方法。鉴于 Khmer 脚本的结构复杂性,如附加符和多层字符堆叠,现有的基于拉丁的布局分析模型难以准确描绘语义布局单元,尤其是针对密集文本区域(如列表项)。本文提出了 Khmer 场景文档布局检测的首个全面研究。我们贡献了一个由三个关键要素构成的新型框架:(1) 为 Khmer 场景布局专门设计的稳健训练和基准数据集;(2) 能够合成真实场景文档以扩充训练数据的开源文档增强工具;(3) 利用基于 YOLO 的体系结构实现的布局检测基线,采用有向边界框 (OBB) 处理几何畸变。为促进 Khmer 文档分析与识别 (DAR) 社区的进一步研究,我们将在本门户仓库中发布模型、代码和数据集(审阅中)。

关键词

引用

@article{arxiv.2603.00707,
  title  = {Towards Khmer Scene Document Layout Detection},
  author = {Marry Kong and Rina Buoy and Sovisal Chenda and Nguonly Taing and Masakazu Iwamura and Koichi Kise},
  journal= {arXiv preprint arXiv:2603.00707},
  year   = {2026}
}

备注

17 pages, 7 figures, 6 tables