Token 瓶颈:记忆动态的唯一 token
计算机视觉与模式识别
2026-03-09 v2
摘要
从动态场景中派生出紧凑且具时序感知力的视觉表征,对顺序场景理解任务(如视觉跟踪和机器人操控)至关重要。本文引入了 Token Bottleneck(ToBo),这是一条简单而直观的自监督学习管道,将场景压缩为瓶颈 token,并用最少的 patch 预测后续场景。ToBo 管道通过保守地将参考场景编码为紧凑的瓶颈 token 来实现压缩步骤,从而促进了顺序场景表征的学习。在重建步骤中,我们利用瓶颈 token 以及少量目标 patch 作为线索来预测目标场景。这种设计鼓励视觉骨干网络嵌入时序依赖,从而实现对动态场景转换的理解。广泛的实验在多样化的顺序任务上进行,包括视频标签传递和仿真环境中的机器人操控,结果表明本方法优于基线方法。此外,将预训练模型部署到物理机器人上 confirms 其在真实环境中的鲁棒性和有效性。我们进一步验证了 ToBo 在不同模型规模下的可扩展性。代码已公开 https://github.com/naver-ai/tobo。
引用
@article{arxiv.2507.06543,
title = {Token Bottleneck: One Token to Remember Dynamics},
author = {Taekyung Kim and Dongyoon Han and Byeongho Heo and Jeongeun Park and Sangdoo Yun},
journal= {arXiv preprint arXiv:2507.06543},
year = {2026}
}
备注
NeurIPS 2025, 18 pages, 9 figures, 10 tables, project page: https://token-bottleneck.github.io, code: https://github.com/naver-ai/tobo