AToken:面向视觉的统一化标记器
计算机视觉与模式识别
2025-09-22 v2 人工智能
多媒体
摘要
我们提出 AToken,首个实现图像、视频和 3D 资产在高保真重建与语义理解能力上双重突破的统一视觉标记器。不同于现有仅专注单一模态重建或理解的标记器,AToken 将这些多样化视觉输入编码为共享的 4D 潜在空间,统一了任务与模态于单一框架。具体而言,我们引入纯 transformer 架构,运用 4D 旋转位置编码处理任意分辨率和时间尺度的视觉输入。为确保训练稳定性,我们提出无对抗训练目标,结合感知损失与格罗姆矩阵损失,实现最先进的重建质量。通过渐进式训练课程,AToken 从单张图像、视频和 3D 渐进式扩展,支持连续型与离散型潜在标记。AToken 在图像上实现 0.21 rFID 及 82.2% ImageNet 精度,在视频上实现 3.01 rFVD 及 40.2% MSRVTT 检索,在 3D 上实现 28.28 PSNR 及 90.9% 分类精度。在下游应用中,AToken 支持视觉生成任务(如连续/离散标记图像生成、文本到视频生成、图像到 3D 合成)及理解任务(如多模态大语言模型),在所有基准上均取得竞争性能。这为构建基于统一视觉标记的下一代多模态 AI 系统指明了方向。
引用
@article{arxiv.2509.14476,
title = {AToken: A Unified Tokenizer for Vision},
author = {Jiasen Lu and Liangchen Song and Mingze Xu and Byeongjoo Ahn and Yanjun Wang and Chen Chen and Afshin Dehghan and Yinfei Yang},
journal= {arXiv preprint arXiv:2509.14476},
year = {2025}
}
备注
30 pages, 14 figures