TRivia:面向表格识别的视觉语言模型自监督精调
计算机视觉与模式识别
2026-03-25 v2
摘要
表格识别(TR)旨在将表格图像转换为类 HTML 或 Markdown 的准结构化表示形式。作为文档解析的核心组件,TR 长期依赖监督学习,近期主要通过使用标记数据对视觉语言模型(VLMs)进行微调。尽管 VLMs 已为 TR 提供了显著提升,但进一步提升性能仍需大规模标记数据,而获取成本高昂。因此,尽管专有模型不断推动性能边界,但常受资源有限限制的开源模型在实际中往往是唯一可行的选择,仍远落后于专有模型。为弥合这一差距,我们引入 TRivia,一种自监督微调方法,使预训练 VLMs 能直接从野生表格图像中学习 TR。基于群体相对策略优化(Group Relative Policy Optimization),TRivia 自动识别最能促进学习的无标记样本,通过基于问答的奖励机制消除对人工标注的需求。注意力引导模块为每个表格图像生成多样化问题,能够正确解释识别结果并回答问题的能力为模型优化提供反馈。该闭环过程使 TR 模型能够在没有标记数据的情况下自主学习表格的识别、结构化和推理。借助这一流程,我们 presented了 TRivia-3B,一个开源、紧凑且在三个流行基准测试中超越现有系统(如 Gemini 2.5 Pro、MinerU2.5)的领先级 TR 模型。模型和代码已发布于:https://github.com/HKU-TASR/TRivia
引用
@article{arxiv.2512.01248,
title = {TRivia: Self-supervised Fine-tuning of Vision-Language Models for Table Recognition},
author = {Junyuan Zhang and Bin Wang and Qintong Zhang and Fan Wu and Zichen Wen and Jialin Lu and Junjie Shan and Ziqi Zhao and Shuya Yang and Ziling Wang and Ziyang Miao and Huaping Zhong and Yuhang Zang and Xiaoyi Dong and Ka-Ho Chow and Conghui He},
journal= {arXiv preprint arXiv:2512.01248},
year = {2026}
}
备注
Accepted by CVPR 2026