Touch-R1:强化触觉推理能力的 MLLMs
计算机视觉与模式识别
2026-05-27 v1
摘要
虽然基于规则的强化学习最近催化了多模态模型中显式推理,但触觉推理仍 largely 未被探索。现有的触觉-语言模型主要依赖监督或对比目标,这限制了其将预测 grounding 在物理证据或纠正误导性视觉先验方面的能力。触觉推理引入了两个模态特定挑战:物理属性(如硬度、粗糙度)的序数特性,以及光学触觉硬件中固有的跨传感器分布迁移。在本工作中,我们引入了 TouchReason-1M,一个包含超过 100 万对同步触觉数据的大规模多模态数据集,涵盖四种不同传感器,并提出了 TouchReason-Bench,用于评估触觉感知和视觉-触觉冲突解决的严格框架。基于这些,我们提出了 Touch-R1,一个基于 Qwen2.5-VL-7B 的触觉推理 MLLM。Touch-R1 通过一种结合序数感知准确性、跨传感器物理一致性、结构化格式控制以及输入端触觉 grounding 目标的触觉 grounding GRPO 目标进行训练。具体而言,触觉-use reward 仅在真实触觉输入相对于反事实控制(其中触觉流被移除、混洗或噪声掩码)时 yield 更高的正确性时才赋予信用。在 TouchReason-Bench 上,Touch-R1-7B 在平均性能上分别比 Octopi-13B 高出 18.4%,比 GPT-4o 高出 24.7%。其结构化推理轨迹揭示了探测、比较和修订等显现行为,表明 R1 风格的推理可以有效地 grounding 在物理接触上。
引用
@article{arxiv.2605.27154,
title = {Touch-R1: Reinforcing Touch Reasoning in MLLMs},
author = {Yingxin Lai and Yafei Zhou and Fucai Zhu and Siyu Zhu and Weihao Yuan},
journal= {arXiv preprint arXiv:2605.27154},
year = {2026}
}
备注
Our code and data will be made public on the https://laiyingxin2.github.io/Projects