中文

面向细粒度文本到 3D 质量评估:基准与双阶段排名学习度量

计算机视觉与模式识别 2025-11-06 v2

摘要

近期文本到 3D(T23D)生成模型的进展使能够从文本提示合成多样化、高保真度的 3D 资产成为可能。然而,现有方法仍面临限制可靠 T23D 质量评估(T23DQA)发展的挑战。首先,现有基准已过时、碎片化且粗粒度,使得细粒度度量训练难以实现。其次,当前客观度量存在设计局限,导致特征提取不具代表性且度量鲁棒性差。为此,本工作引入 T23D-CompBench,一个用于组合化 T23D 生成的全面基准。我们定义了包含十二个子组成分的五个组成分,用于组合化提示,这些组成分用于从十个最先进的生成模型中生成 3,600 个带纹理的网格。我们进行大规模主观实验,收集来自不同视角的 129,600 条可靠人类评分。基于 T23D-CompBench,我们进一步提出了 Rank2Score,一个用于 T23DQA 的有效评估器,采用双阶段训练。第一阶段通过监督对比回归和课程学习来增强成对训练;第二阶段则利用平均意见分数(MOS)来优化预测,使其更贴近人类判断。在广泛的实验和下游应用中,Rank2Score 在多个维度上 consistently 优于现有度量,并且还可作为优化生成模型的奖励函数。项目已公开:https://cbysjtu.github.io/Rank2Score/。

关键词

引用

@article{arxiv.2509.23841,
  title  = {Towards Fine-Grained Text-to-3D Quality Assessment: A Benchmark and A Two-Stage Rank-Learning Metric},
  author = {Bingyang Cui and Yujie Zhang and Qi Yang and Zhu Li and Yiling Xu},
  journal= {arXiv preprint arXiv:2509.23841},
  year   = {2025}
}