TPRU:提高大型多模态模型的时间和程序理解能力
人工智能
2026-02-24 v1
摘要
多模态大型语言模型(MLLMs),尤其是较小且可部署的变体,在理解时间和程序性视觉数据方面存在关键缺陷,这一瓶颈阻碍了其在现实世界具身 AI 应用中的落地。这种差距主要源于训练范式的系统性失效,缺乏大规模、程序一致的数据。为此,我们提出了 TPRU,一个来自多样化具身场景(如机器人操作和 GUI 导航)的大规模数据集。TPRU 系统性地设计用于通过三种互补任务培育时间推理:时间重排、下一帧预测和上一帧回顾。其关键特征是包含具有挑战性的负样本,迫使模型从被动观察转向主动的跨模态验证。我们利用 TPRU 进行强化学习(RL)微调,专门针对资源高效模型的提升。实验表明,我们的方法取得显著进展:在我们手动精选的 TPRU-Test 上,TPRU-7B 的准确率从 50.33% 提升至 75.70%,取得 state-of-the-art 结果,显著优于更大规模的基线,包括 GPT-4o。关键的是,这些能力有效地通用,显示出在既定基准测试上实现显著改进。代码地址为 https://github.com/Stephen-gzk/TPRU/。
引用
@article{arxiv.2602.18884,
title = {TPRU: Advancing Temporal and Procedural Understanding in Large Multimodal Models},
author = {Zhenkun Gao and Xuhong Wang and Xin Tan and Yuan Xie},
journal= {arXiv preprint arXiv:2602.18884},
year = {2026}
}
备注
Accepted to ICLR 2026. 17 pages. Code, data, and models are available at: https://github.com/Stephen-gzk/TPRU