面向触觉-视觉-语言模型的测试时适应
机器人学
2026-02-19 v1 人工智能
摘要
触觉-视觉-语言(Tactile-vision-language, TVL)模型日益在实际机器人及多模态感知任务中部署,但在这些场景中不可避免地面临测试时分布迁移。现有的测试时适应(Test-Time Adaptation, TTA)方法在单模态设置中提供过滤功能,但缺乏对跨模态异步迁移下各模态可靠性的显式处理,导致在某些模态变得不可靠时方法脆弱。我们研究面对此类迁移的TVL模型测试时适应,提出一种可靠性感知框架,从预测不确定性和扰动响应中估计各模态的可靠性。该框架共享的可靠性信号用于(i)过滤不可靠的测试样本,(ii)自适应融合触觉、视觉和语言特征,(iii)以可靠性导向的目标对测试时优化进行正则化。在TAG-C基准测试及其他TVL场景中,我们的方法持续优于强大的TTA基线,在严重模态损坏情况下实现最高可达49.9%的准确率提升,凸显了对显式模态可靠性建模在稳健测试时适应中的重要性。
引用
@article{arxiv.2602.15873,
title = {Test-Time Adaptation for Tactile-Vision-Language Models},
author = {Chuyang Ye and Haoxian Jing and Qinting Jiang and Yixi Lin and Qiang Li and Xing Tang and Jingyan Jiang},
journal= {arXiv preprint arXiv:2602.15873},
year = {2026}
}