中文

面向汽车 CAN 数据的基础语言模型:Foundation CAN LM

人工智能 2026-02-03 v1 计算与语言

摘要

控制区域网络 (CAN)总线为汽车信号提供了丰富的来源,日益被用于包括碰撞检测、预测性维护和驾驶风险建模在内的汽车和自动保险领域的应用。尽管存在这种潜力,现有管道基本上是在原始 CAN 数据上训练孤立的任务特定模型,仅限于少量探索解码信号的努力。这种碎片化的做法阻碍了共享表示学习,限制了跨任务的泛化。相比之下,自然语言处理 (NLP) 和计算机视觉 (CV) 已被基础模型范式所变革:大规模预训练后跟随任务特定的适应。在本工作中,我们介绍了 demonstrate 多目标下游泛化的 foundation CAN 模型,该模型使用单个预训练 backbone。我们的 approach 将 CAN 数据视为语言:我们在大规模、无标记解码 CAN 信号上进行预训练,并在异构的自动保险任务上进行微调。为此,我们提出了一种用于混合离散-连续信号的统一标记方案,并解决了时间复杂性和 trip-specific 可变性的挑战。我们的结果表明,一个预训练的 CAN 模型可以有效适应多样化的预测任务,验证了在 NLP 和 CV 中已证明的基础模型范式也适用于 CAN 数据。这为汽车 AI 中的通用表示学习开辟了新的方向。

关键词

引用

@article{arxiv.2602.00866,
  title  = {Foundation CAN LM: A Pretrained Language Model For Automotive CAN Data},
  author = {Akiharu Esashi and Pawissanutt Lertpongrujikorn and Justin Makino and Yuibi Fujimoto and Mohsen Amini Salehi},
  journal= {arXiv preprint arXiv:2602.00866},
  year   = {2026}
}