中文

NVIDIA Nemotron Parse 1.1

机器学习 2025-11-26 v1

摘要

我们介绍 Nemotron-Parse-1.1,这是一个轻量级文档解析和OCR模型,超越其前身 Nemoretriever-Parse-1.0。Nemotron-Parse-1.1 在通用OCR、markdown 格式化、结构化表格解析以及从图片、图表和图示中提取文本方面提供了改进的能力。它还支持更长的输出序列长度以适应视觉密集型文档。如同其前身,它提取文本片段的边界框以及相应的语义类别。Nemotron-Parse-1.1 采用编码器-解码器架构,包含8.85亿参数,其中包括2.56亿参数的紧凑语言解码器。在公共基准测试中实现了具竞争力的准确率,使其成为强大的轻量级OCR解决方案。我们在 Huggingface 上公开发布模型权重,以及优化的 NIM 容器,同时作为更广泛的 Nemotron-VLM-v2 数据集的一部分发布了训练数据的子集。此外,我们发布 Nemotron-Parse-1.1-TC,该模型在视觉标记长度上进行了压缩,提供约20%的速度提升,同时在质量上几乎没有退化。

关键词

引用

@article{arxiv.2511.20478,
  title  = {NVIDIA Nemotron Parse 1.1},
  author = {Kateryna Chumachenko and Amala Sanjay Deshmukh and Jarno Seppanen and Ilia Karmanov and Chia-Chih Chen and Lukas Voegtle and Philipp Fischer and Marek Wawrzos and Saeid Motiian and Roman Ageev and Kedi Wu and Alexandre Milesi and Maryam Moosaei and Krzysztof Pawelec and Padmavathy Subramanian and Mehrzad Samadi and Xin Yu and Celina Dear and Sarah Stoddard and Jenna Diamond and Jesse Oliver and Leanna Chraghchian and Patrick Skelly and Tom Balough and Yao Xu and Jane Polak Scowcroft and Daniel Korzekwa and Darragh Hanley and Sandip Bhaskar and Timo Roman and Karan Sapra and Andrew Tao and Bryan Catanzaro},
  journal= {arXiv preprint arXiv:2511.20478},
  year   = {2025}
}