中文

从理论到吞吐量:CUDA 优化的 APML 用于大批量 3D 学习

机器学习 2025-12-24 v1 人工智能 计算几何

摘要

损失函数是学习准确 3D 点云模型的基础,但常见选择在计算成本与几何保真度之间进行权衡。切里夫距离计算高效,但允许许多对一对应关系;而地球位移距离更能反映一对一运输,但计算成本极高。APML 通过可微 Sinkhorn 迭代和解析推导的温度来近似运输,其稠密公式在内存中呈二次比例扩张。我们提出了 CUDA-APML,一种稀疏 GPU 实现,通过阈值化消除可忽略的赋值并在 COO 格式中运行自适应 Softmax、双向对称化和 Sinkhorn 归一化。这实现了近线性内存扩张,同时保留存储支持点的梯度,虽然当前实现中仍保持两两距离评估的二次复杂度。在 ShapeNet 和 MM-Fi 上,CUDA-APML 在轻微容忍范围内匹配稠密 APML,同时将峰值 GPU 内存降低 99.9%。代码已公开:https://github.com/Multimodal-Sensing-Lab/apml

关键词

引用

@article{arxiv.2512.19743,
  title  = {From Theory to Throughput: CUDA-Optimized APML for Large-Batch 3D Learning},
  author = {Sasan Sharifipour and Constantino Álvarez Casado and Manuel Lage Cañellas and Miguel Bordallo López},
  journal= {arXiv preprint arXiv:2512.19743},
  year   = {2025}
}

备注

5 pages, 2 figures, 2 tables, 5 formulas, 34 references, journal paper