TTF-VLA: 通过像素注意力整合实现视觉-语言-动作模型的时间 Token 融合
计算机视觉与模式识别
2025-11-17 v3 人工智能
机器学习
机器人学
摘要
视觉-语言-动作(VLA)模型在每个时间步独立处理视觉输入,丢弃了机器人操作任务中固有的宝贵时间信息。这种逐帧处理使模型易受视觉噪声影响,同时忽略了操作序列中连续帧之间的高度一致性。我们提出了时间 Token 融合(TTF),一种无需训练的方法,通过智能整合历史与当前视觉表示来增强 VLA 推理质量。该方法采用双维度检测,结合高效的灰度像素差异分析与基于注意力的语义相关性评估,通过硬融合策略和关键帧锚定实现选择性时间 Token 融合,以防止误差累积。在 LIBERO、SimplerEnv 和真实机器人任务上的全面实验证明了一致的改进:在 LIBERO 上平均提升 4.0 个百分点(72.4% 对比 68.4% 基线),在 SimplerEnv 上进行跨环境验证(相对提升 4.8%),在真实机器人任务上相对提升 8.7%。该方法被证明是模型无关的,适用于 OpenVLA 和 VLA-Cache 架构。值得注意的是,TTF 揭示了在注意力机制中选择性 Query 矩阵复用能够提升而非损害性能,这为实现计算加速同时提高任务成功率的直接 KQV 矩阵复用策略指明了有前景的方向。
引用
@article{arxiv.2508.19257,
title = {TTF-VLA: Temporal Token Fusion via Pixel-Attention Integration for Vision-Language-Action Models},
author = {Chenghao Liu and Jiachen Zhang and Chengxuan Li and Zhimu Zhou and Shixin Wu and Songfang Huang and Huiling Duan},
journal= {arXiv preprint arXiv:2508.19257},
year = {2025}
}
备注
Accepted to AAAI 2026. Camera-ready version