OmniVaT:多模态视觉-触觉学习中的单域泛化
计算机视觉与模式识别
2026-01-05 v1
摘要
视觉-触觉学习(VTL)使具身智能体通过整合视觉(VIS)和触觉(TAC)传感器来感知物理世界。然而,VTL 仍面临 VIS 与 TAC 图像之间的模态差异,以及由非标准化触觉传感器和不一致数据收集程序导致的域间差异问题。我们将这些挑战定义为一种新任务,称为多模态 VTL 的单域泛化(SDG-VTL)。本文提出了 OmniVaT 框架,首次成功解决了该任务。一方面,OmniVaT 集成了多模态分数傅里叶适配器(MFFA),将 VIS 和 TAC 嵌入映射到统一的嵌入频率空间,从而无需多域训练数据或精细的跨模态融合策略,有效缓解了模态差距。另一方面,它还包含离散树生成(DTG)模块,通过层次化树结构获取多样化且可靠的多模态分数傅里叶表示,从而增强其对不可见域中波动域迁移的适应性。大量实验表明,OmniVaT 在 SDG-VTL 任务上展现出卓越的跨域泛化性能。
引用
@article{arxiv.2601.00352,
title = {OmniVaT: Single Domain Generalization for Multimodal Visual-Tactile Learning},
author = {Liuxiang Qiu and Hui Da and Yuzhen Niu and Tiesong Zhao and Yang Cao and Zheng-Jun Zha},
journal= {arXiv preprint arXiv:2601.00352},
year = {2026}
}