中文

PAT-VCM:面向机器视频编码的即插即用辅助令牌

计算机视觉与模式识别 2026-05-01 v2

摘要

现有的面向机器视频编码通常针对特定的下游任务和模型进行训练。因此,压缩表示与最终任务紧密耦合,使得难以跨多个任务扩展或适应模型更新。我们提出了 PAT-VCM,一个面向机器视频编码的即插即用辅助令牌框架。PAT-VCM 保持一个共享的基线压缩流,并用轻量级的任务感知辅助令牌对其进行增强,允许不同的下游任务恢复它们所需的信息,而无需为每个任务重新训练单独的编解码器。该框架支持三种形式的辅助信息:视觉残差令牌、提示/控制令牌和语义令牌。我们在分割、深度估计和语义识别上评估了 PAT-VCM。一个共享的检测导向辅助分支提供了可重复使用的首次细化,任务特定的视觉分支改善了分割和深度,提示令牌以可忽略的比特率提供了进一步的分割增益,而语义令牌以极低的开销实现了强大的识别性能。这些结果表明,共享的压缩表示与轻量级的任务感知辅助令牌相结合,是紧密任务耦合的 VCM 设计的一种实用且可扩展的替代方案。

关键词

引用

@article{arxiv.2604.13294,
  title  = {PAT-VCM: Plug-and-Play Auxiliary Tokens for Video Coding for Machines},
  author = {Wei Jiang and Wei Wang},
  journal= {arXiv preprint arXiv:2604.13294},
  year   = {2026}
}

备注

22 pages, 4 figures, 23 tables