中文

TTT-KD:通过基础模型知识蒸馏进行 3D 语义分割的测试时训练

计算机视觉与模式识别 2024-03-19 v1

摘要

测试时训练 (TTT) 提出在运行中使预训练网络适应不断变化的数据分布。在本工作中,我们提出了首个用于 3D 语义分割的 TTT 方法 TTT-KD,该方法将来自基础模型(例如 DINOv2)的知识蒸馏 (KD) 建模为在测试时适应分布偏移的自监督目标。在可以访问成对的图像-点云 (2D-3D) 数据的情况下,我们首先利用点云和现成的 2D 预训练基础模型,通过 2D \to 3D KD 任务来优化 3D 分割主干网络,以完成语义分割的主要任务。在测试时,我们的 TTT-KD 在执行最终预测之前,利用知识蒸馏的自监督任务为每个测试样本更新 3D 分割主干网络。在多个室内和室外 3D 分割基准上的广泛评估表明了 TTT-KD 的有效性,它提高了分布内 (ID) 和分布外 (OOD) 测试数据集的性能。当训练和测试分布相似时,我们实现了高达 13% 的 mIoU 提升(平均 7%),在适应 OOD 测试样本时实现了高达 45% 的提升(平均 20%)。

关键词

引用

@article{arxiv.2403.11691,
  title  = {TTT-KD: Test-Time Training for 3D Semantic Segmentation through Knowledge Distillation from Foundation Models},
  author = {Lisa Weijler and Muhammad Jehanzeb Mirza and Leon Sick and Can Ekkazan and Pedro Hermosilla},
  journal= {arXiv preprint arXiv:2403.11691},
  year   = {2024}
}