中文

几何代数遇见大语言模型:基于指令的 3D 场景中独立网格的交互式可控变换

计算机视觉与模式识别 2025-07-30 v2 人工智能 图形学

摘要

本文介绍了一种将大语言模型(LLM)与共形几何代数(CGA)集成以革新可控 3D 场景编辑的新方法,尤其是针对对象 repositioning 任务,这类传统任务需要复杂的手动流程和专业知识。这些传统方法通常依赖大量训练数据或缺乏精确编辑的形式化语言。利用 CGA 作为稳健的形式化语言,我们的系统 Shenlong 精确建模了实现准确对象 repositioning 所需的空间变换。借助预训练 LLM 的零样本学习能力,Shenlong 将自然语言指令翻译为 CGA 操作,然后应用于场景中,以实现 3D 场景内的精确空间变换,而无需专业预训练。实现于真实的仿真环境中,Shenlong 确保与现有图形管线的兼容性。为准确评估 CGA 的影响,我们使用稳健的欧几里得空间基线进行基准测试,评估延迟和准确性。比较性能评估表明,Shenlong 将 LLM 响应时间缩短 16%,平均提升成功率 9.6%。值得注意的是,Shenlong 在常见实际查询中实现 100% 完美成功率,而其他系统在此基准上屈服于望。这些突破凸显了 Shenlong 的潜力,旨在民主化 3D 场景编辑,提升可访问性并在教育、数字娱乐和虚拟现实等领域促进创新。

关键词

引用

@article{arxiv.2408.02275,
  title  = {Geometric Algebra Meets Large Language Models: Instruction-Based Transformations of Separate Meshes in 3D, Interactive and Controllable Scenes},
  author = {Prodromos Kolyvakis and Manos Kamarianakis and George Papagiannakis},
  journal= {arXiv preprint arXiv:2408.02275},
  year   = {2025}
}

备注

10 pages, 4 figures