中文

CoherenDream:通过多模态大语言模型反馈提升 3D 生成文本整体一致性

计算机视觉与模式识别 2025-08-14 v3

摘要

得分蒸馍采样(SDS)在文本到 3D 内容生成方面取得了显著成功。然而,基于 SDS 的方法在保持用户提示语的语义忠实度方面存在挑战,尤其是当涉及多个具有复杂相互作用的对象时。虽然已有方法通常通过在 3D 数据集上对 3D 扩散模型进行多视图微调来解决 3D 一致性问题,但这一策略不无会加剧文本-3D 对齐 degradation。该限制源于 SDS 在优化过程中积累的与视图无关偏差,逐渐偏离理想的文本对齐方向。为缓解此限制,我们提出一种新颖的 SDS 目标,称为文本一致得分蒸馍(TCSD),该方法整合了来自多模态大语言模型(MLLMs)的对齐反馈。我们的 TCSD 利用 MLLMs 的跨模态理解能力,在优化过程中评估和引导文本-3D 对应关系。我们进一步开发了 3DLLaVA-CRITIC——一个专为评估 3D 生成的多视图文本对齐而微调的 MLLM。此外,我们引入了一种 LLM-布局初始化,通过语义感知的空间配置显著加快优化收敛速度。我们的框架 CoherenDream 在 TIFA 数据集子集上实现了一致的性能提升。作为首个将 MLLMs 融入 SDS 优化的研究,我们还进行了大量消融实验,以探讨针对 3D 生成任务的最佳 MLLM 适应方案。

关键词

引用

@article{arxiv.2504.19860,
  title  = {CoherenDream: Boosting Holistic Text Coherence in 3D Generation via Multimodal Large Language Models Feedback},
  author = {Chenhan Jiang and Yihan Zeng and Dit-Yan Yeung},
  journal= {arXiv preprint arXiv:2504.19860},
  year   = {2025}
}