DocPO: Advancing Document Policy Optimization via Tailored Step-Aware Rewards
Abstract
Reinforcement learning (RL) for document parsing often relies on reference-based rewards rooted in edit distance (e.g., tree edit distance), yet it remains hard to optimize in the high-accuracy regime because such rewards become weakly discriminative: near-correct outputs receive very similar scores, providing limited learning signal for hard cases. We propose Step-Aware Annealing (SAA), a plug-and-play reward sharpening mechanism that progressively increases reward curvature during training, amplifying subtle quality differences among high-scoring samples while preserving stability in early learning. Built on SAA, we introduce DocPO, a document policy optimization framework with element-specific, reference-based rewards anchored by edit-distance signals: normalized string edit distance (NED) for text, tree edit distance similarity (TEDS) for tables, and a hybrid Rubric+edit reward for formulas. Experiments on OmniDocBench and DocElemHard show that SAA consistently improves GRPO-style RL across document elements over non-annealed rewards, without requiring additional human supervision for reward construction.
Cite
@article{arxiv.2608.00536,
title = {DocPO: Advancing Document Policy Optimization via Tailored Step-Aware Rewards},
author = {Yunhao Wang and Binghong Wu and Zhenyu Huang and Jiacheng Shi and Shuo Huang and Tinghao Yu and Feng Zhang},
journal= {arXiv preprint arXiv:2608.00536},
year = {2026}
}
Comments
14 pages. Accepted to the 34th ACM International Conference on Multimedia (ACM Multimedia 2026). Yunhao Wang and Binghong Wu contributed equally