中文

一种通用模型搞定:异构协同感知中的全模态任意翻译

计算机视觉与模式识别 2026-05-19 v1 人工智能

摘要

通过共享中间特征,协同感知能够扩展每个智能体的感知范围,但现实世界的特征模态异构性仍是有效融合的关键障碍。大多数现有方法,包括直接适配和协议式转换,通常依赖于为新出现的特征模态训练适配器,往往需要额外的重新训练或微调。这种重复训练成本高昂,且由于模型和数据隐私限制,往往难以在不同制造商之间实现,限制了现实世界的可扩展性。为此,我们提出了 UniTrans—a 通用任意-to.任意特征模态翻译模型,该模型可为任意模态即时实例化翻译器。UniTrans 对翻译专家参数进行预训练,并学习其组合系数作为源到目标模态映射的函数。该映射在模态内在潜在空间中度量,where 一个内在编码器从单帧中间特征中提取出特定于模态且对场景不变的编码,使 UniTrans 能够以零样本方式实例化翻译器。OPV2V-H 和 DAIR-V2X 上的实验表明,UniTrans 在模拟和真实场景中均优于最新方法,实现了通过通用模型进行高效的任意模态翻译。代码已公开于 https://github.com/CheeryLeeyy/UniTrans。

关键词

引用

@article{arxiv.2605.17907,
  title  = {One Model to Translate Them All: Universal Any-to-Any Translation for Heterogeneous Collaborative Perception},
  author = {Yang Li and Weize Li and Quan Yuan and Congzhang Shao and Guiyang Luo and Yunqi Ba and Xuanhan Zhu and Xinyuan Ding and Xiaoyuan Fu and Jinglin Li},
  journal= {arXiv preprint arXiv:2605.17907},
  year   = {2026}
}

备注

19 pages, accepted at the 43rd International Conference on Machine Learning (ICML 2026)