PaperFit:面向科学文档的视觉闭环排版优化
人工智能
2026-05-12 v1 软件工程
摘要
能够顺利编译的LaTeX稿件未必具备出版就绪状态。生成的PDF常出现浮动元素错位、方程溢出、表格比例不一致、独行/孤行以及页面平衡差等问题,迫使作者频繁进行编译-检查-编辑的循环。基于规则的工具仅关注源代码和日志文件,无法感知渲染后的视觉效果。文本-only大语言模型进行开环文本编辑,无法预测或验证其修改对二维布局的影响。可靠的排版优化需要具备视觉闭环验证能力。我们将此问题形式化为视觉排版优化(VTO):将可编译的LaTeX论文转化为具备页面预算约束的视觉精炼PDF,通过迭代视觉验证与源代码级修订实现。我们构建了PaperFit-Bench,包含200篇论文、10个会议模板及13种排版缺陷类型(不同难度),用于评估VTO任务。实验表明,PaperFit在所有基线方法上均显著优越,证明从可编译源码到出版就绪PDF之间的鸿沟需要视觉闭环优化,而VTO是文档自动化流程中缺失的关键环节。
引用
@article{arxiv.2605.10341,
title = {PaperFit: Vision-in-the-Loop Typesetting Optimization for Scientific Documents},
author = {Bihui Yu and Xinglong Xu and Junjie Jiang and Jiabei Cheng and Caijun Jia and Siyuan Li and Conghui He and Jingxuan Wei and Cheng Tan},
journal= {arXiv preprint arXiv:2605.10341},
year = {2026}
}
备注
47 pages, 17 figures, 17 tables