中文

泰语文档提取开放视觉语言模型——Typhoon OCR

计算与语言 2026-01-22 v1

摘要

文档提取是数字化工作流程的核心组成部分,但现有的视觉语言模型(VLM)主要侧重于高资源语言。泰语因非拉丁文字、缺乏显式词边界以及高度非结构化的真实文档而面临额外挑战,限制了当前开源模型的有效性。本文提出 Typhoon OCR,一个为泰语和英语量身定制的开放 VLM,用于文档提取。该模型基于视觉语言骨干网络进行微调,采用以泰语为中心的训练数据集。数据集通过结合传统 OCR、VLM 重构和精选合成数据的多阶段构建流程获得。Typhoon OCR 是一个统一的框架,能够实现文本转录、版面重建和文档级结构一致性。本模型的最新版本 Typhoon OCR V1.5 是一个紧凑且高效的推理模型,旨在减少对元数据的依赖并简化部署。在涵盖财务报告、政府表格、书籍、信息图和手写文档等多样化泰语文档类别的全面评估中,Typhoon OCR 的性能不仅与或超过大型主流专有模型,还在计算成本大幅降低的情况下取得了优异成绩。这些结果表明,开放视觉语言 OCR 模型能够为泰语文档实现准确的文本提取和版面重建,达到与专有系统相当的性能,同时保持轻量级和可部署性。

关键词

引用

@article{arxiv.2601.14722,
  title  = {Typhoon OCR: Open Vision-Language Model For Thai Document Extraction},
  author = {Surapon Nonesung and Natapong Nitarach and Teetouch Jaknamon and Pittawat Taveekitworachai and Kunat Pipatanakul},
  journal= {arXiv preprint arXiv:2601.14722},
  year   = {2026}
}