Uni-MuMER:面向手写数学表达式识别的视觉-语言模型统一多任务微调
计算机视觉与模式识别
2025-10-28 v4
摘要
由于符号布局的内在自由性和手写风格的多样性,手写数学表达式识别 (HMER) 仍然是光学字符识别 (OCR) 中的一项持久挑战。以往的方法通过提出孤立的架构修改来应对性能瓶颈,这使得它们难以连贯地整合到一个统一框架中。同时,预训练视觉-语言模型 的最新进展展示了强大的跨任务泛化能力,为开发统一解决方案提供了有前景的基础。在本文中,我们引入了 Uni-MuMER,它在不修改架构的情况下针对 HMER 任务对 VLM 进行全面微调,有效地将领域特定知识注入到通用框架中。我们的方法整合了三个数据驱动的任务:用于结构化空间推理的树感知思维链;用于减少视觉相似字符间混淆的误差驱动学习 (EDL);以及用于提高长表达式识别一致性的符号计数 (SC)。在 CROHME 和 HME100K 数据集上的实验表明,Uni-MuMER 取得了超 SOTA 的性能,比最佳轻量级专用模型 SSAN 高出 16.31\%,并在零样本设置下比性能最优的 VLM Gemini2.5-flash 高出 24.42\%。我们的数据集、模型和代码已开源于:https://github.com/BFlameSwift/Uni-MuMER
引用
@article{arxiv.2505.23566,
title = {Uni-MuMER: Unified Multi-Task Fine-Tuning of Vision-Language Model for Handwritten Mathematical Expression Recognition},
author = {Yu Li and Jin Jiang and Jianhua Zhu and Shuai Peng and Baole Wei and Yuxuan Zhou and Liangcai Gao},
journal= {arXiv preprint arXiv:2505.23566},
year = {2025}
}
备注
Accepted by NeurIPS 2025 as a spotlight