中文

全凭 Token:通过软 Token 统一视觉任务的输出空间

计算机视觉与模式识别 2023-02-15 v2 人工智能

摘要

与输出空间通常限于一组 token 的语言任务不同,视觉任务的输出空间更为复杂,难以针对各种视觉任务构建统一的视觉模型。在本文中,我们试图统一视觉任务的输出空间,从而也能为视觉任务构建统一模型。为此,我们展示了一个单一统一模型,可同时处理实例分割和深度估计这两个典型视觉任务,它们分别具有离散/固定长度和连续/变长输出。我们提出了几种考虑视觉任务特殊性的新技术:1) 软 token。我们采用软 token 表示任务输出。与常见 VQ-VAE 中分配给离散码本/词表的一热硬 token 不同,软 token 以软方式分配给码本嵌入。软 token 可提升下一 token 推断和任务输出解码的精度;2) 掩码增强。许多视觉任务在标签标注中存在损坏、未定义或无效值,即深度图的遮挡区域。我们表明掩码增强技术可极大裨益此类任务。借助这些新技术及其他设计,我们展示了所提出的通用任务求解器能良好地完成实例分割与深度估计。特别地,我们在 NYUv2 深度估计这一特定任务上取得了 0.279 RMSE,在该基准上创下新纪录。该通用任务求解器称为 AiT,代码见 \url{https://github.com/SwinTransformer/AiT}。

关键词

引用

@article{arxiv.2301.02229,
  title  = {All in Tokens: Unifying Output Space of Visual Tasks via Soft Token},
  author = {Jia Ning and Chen Li and Zheng Zhang and Zigang Geng and Qi Dai and Kun He and Han Hu},
  journal= {arXiv preprint arXiv:2301.02229},
  year   = {2023}
}