Mesh-Pro:基于异步优势引导排序偏好优化的艺术风格四边形网格生成
计算机视觉与模式识别
2026-03-03 v1
摘要
强化学习(RL)在文本和图像生成中取得了显著成功,但在3D生成领域的潜力仍未得到充分探索。现有方法通常依赖离线直接偏好优化(DPO),存在训练效率低和泛化能力有限的问题。本文旨在提升RL在3D网格生成中的训练效率和生成质量。具体而言:(1)我们设计了首个针对3D网格生成的异步在线RL框架,后训练效率提升3.75倍于同步RL。(2)我们提出优势引导排序偏好优化(ARPO),一种新的RL算法,在当前为3D网格生成设计的RL算法(如DPO和分组相对策略优化(GRPO))之间实现更佳的训练效率与泛化能力之间的权衡。(3)基于异步ARPO,我们提出Mesh-Pro,进一步引入一种新颖的对角感知混合三角形-四边形分词,用于网格表示,并引入基于射线的几何完整性奖励。Mesh-Pro在艺术网格和稠密网格上实现了最先进的性能。
引用
@article{arxiv.2603.00526,
title = {Mesh-Pro: Asynchronous Advantage-guided Ranking Preference Optimization for Artist-style Quadrilateral Mesh Generation},
author = {Zhen Zhou and Jian Liu and Biwen Lei and Jing Xu and Haohan Weng and Yiling Zhu and Zhuo Chen and Junfeng Fan and Yunkai Ma and Dazhao Du and Song Guo and Fengshui Jing and Chunchao Guo},
journal= {arXiv preprint arXiv:2603.00526},
year = {2026}
}
备注
Accepted to CVPR 2026