中文

BrepLLM:基于大语言模型的原生边界表示理解

计算机视觉与模式识别 2025-12-19 v1

摘要

当前基于 token 序列的大语言模型(LLM)不适合直接处理包含复杂几何与拓扑信息的 3D 边界表示(Brep)模型。我们提出 BrepLLM,这是首个使 LLM 能够解析和推理原始 Brep 数据的框架,弥合了结构化 3D 几何与自然语言之间的模态鸿沟。BrepLLM 采用两阶段训练流水线:跨模态对齐预训练和多阶段 LLM 微调。在第一阶段,自适应 UV 采样策略将 Brep 转换为包含几何与拓扑信息的图表示。随后我们设计了一个分层 BrepEncoder,从几何(即面和边)和拓扑中提取特征,生成一个全局 token 和一系列节点 token。然后通过对比学习将全局 token 与冻结的 CLIP 文本编码器(ViT-L/14)的文本嵌入对齐。在第二阶段,我们将预训练的 BrepEncoder 集成到 LLM 中。随后使用三阶段渐进训练策略对其节点 token 序列进行对齐:(1) 训练从 Brep 表示到 2D 的基于 MLP 的语义映射,结合 2D-LLM 先验;(2) 对 LLM 进行微调;(3) 设计混合查询专家(MQE)以增强几何多样性建模。我们还构建了 Brep2Text,一个包含 269,444 个 Brep-文本问答对的数据集。实验表明,BrepLLM 在 3D 目标分类和描述生成任务上取得了最先进(SOTA)结果。

关键词

引用

@article{arxiv.2512.16413,
  title  = {BrepLLM: Native Boundary Representation Understanding with Large Language Models},
  author = {Liyuan Deng and Hao Guo and Yunpeng Bai and Yongkang Dai and Huaxi Huang and Yilei Shi},
  journal= {arXiv preprint arXiv:2512.16413},
  year   = {2025}
}