中文

MultiDiffSense: 基于深度学习的多模态视觉-触觉图像生成,基于物体形状和接触姿态

计算机视觉与模式识别 2026-02-24 v1 人工智能

摘要

获取对齐的视觉-触觉数据集较慢且昂贵,需要专业硬件和大规模数据收集。合成生成虽有前景,但以往方法通常仅针对单一模态,限制了跨模态学习。我们提出 MultiDiffSense,一个统一的扩散模型,用于在单个架构中合成多个基于视觉的触觉传感器 (ViTac、TacTip、ViTacTip) 的图像。我们的做法基于 CAD 提取、姿态对齐的深度图和编码传感器类型和 4-DOF 接触姿态的结构化提示进行双重条件控制,实现可控且物理一致的多模态合成。在 8 个物体 (5 个见过的,3 个未见过的) 和未见姿态上进行评估,MultiDiffSense 在 SSIM 上相较于 Pix2Pix cGAN 基线分别提升了 +36.3% (ViTac)、+134.6% (ViTacTip) 和 +64.7% (TacTip)。对于下游 3-DOF 姿态估计,混合 50% 合成数据和 50% 真实数据可将所需的真实数据数量减半,同时保持竞争性能。MultiDiffSense 缓解了触觉感知数据收集的瓶颈,使机器人应用的可扩展且可控的多模态数据集生成成为可能。

关键词

引用

@article{arxiv.2602.19348,
  title  = {MultiDiffSense: Diffusion-Based Multi-Modal Visuo-Tactile Image Generation Conditioned on Object Shape and Contact Pose},
  author = {Sirine Bhouri and Lan Wei and Jian-Qing Zheng and Dandan Zhang},
  journal= {arXiv preprint arXiv:2602.19348},
  year   = {2026}
}

备注

Accepted by 2026 ICRA