SEA-Vision:面向东南亚的文档与场景文本理解的综合多语言基准
计算与语言
2026-03-17 v1
摘要
多语文档和场景文本理解在搜索、金融和公共服务等应用中发挥重要作用。然而,大多数现有基准聚焦于高资源语言,未能在真实的多语言环境中评估模型。在东南亚,语言多样性、复杂的书写系统和高度多样的文档类型使这一挑战更加严峻。我们引入 SEA-Vision,一个在 11 种东南亚语言上联合评估文档解析和以文本为中心的视觉问答(TEC-VQA)的基准。SEA-Vision 包含来自九种代表性文档类型的 15,234 个文档解析页面,标注了层次化的页面级、块级和行级标签。它还提供 7,496 个 TEC-VQA 问答对,探测文本识别、数值计算、比较分析、逻辑推理和空间理解。为了使这种多语言、多任务标注可行,我们设计了一个文档解析和 TEC-VQA 的混合流程。它结合自动过滤和评分与多语言大语言模型辅助标注和轻量级母语者验证,大幅减少了人工标注,同时保持了高质量。我们评估了几种领先的多模态模型,观察到低资源东南亚语言上明显的性能退化,突显了多语文档和场景文本理解中仍然存在的显著差距。我们相信 SEA-Vision 将推动文档和场景文本理解的全球进展。
引用
@article{arxiv.2603.15409,
title = {SEA-Vision: A Multilingual Benchmark for Comprehensive Document and Scene Text Understanding in Southeast Asia},
author = {Pengfei Yue and Xingran Zhao and Juntao Chen and Peng Hou and Wang Longchao and Jianghang Lin and Shengchuan Zhang and Anxiang Zeng and Liujuan Cao},
journal= {arXiv preprint arXiv:2603.15409},
year = {2026}
}
备注
Accepted By CVPR2026