中文

CSPO: 缓解结构化表格到 LaTeX 生成中的奖励歧义问题

人工智能 2026-04-14 v1

摘要

表格包含丰富的结构化信息,但存储为图像后,其内容仍被“锁定”在像素中。将表格图像转换为 LaTeX 代码可实现忠实的数字化重用,但当前的多模态大语言模型(MLLM)往往难以保持结构、样式或内容的忠实度。传统的强化学习(RL)后训练通常依赖单一聚合奖励,导致奖励歧义,使其混合了多种行为方面,阻碍有效优化。我们提出了组件特定策略优化(CSPO),一种分离LaTeX表格各组件(结构、样式、内容)优化的RL框架。具体而言,CSPO为各组件分配特定奖励,并仅通过与该组件相关的标记反向传播,从而缓解奖励歧义,实现针对性的组件级优化。为全面评估性能,我们引入了一套分层评估指标。大量实验表明CSPO的有效性,凸显了针对可靠结构化生成进行组件特定优化的重要性。

关键词

引用

@article{arxiv.2604.10918,
  title  = {CSPO: Alleviating Reward Ambiguity for Structured Table-to-LaTeX Generation},
  author = {Yunfan Yang and Cuiling Lan and Jitao Sang and Yan Lu},
  journal= {arXiv preprint arXiv:2604.10918},
  year   = {2026}
}

备注

Accepted by ACL2026 (main conference)