通过信息增强中和标记聚合以实现高效测试时适应
计算机视觉与模式识别
2025-08-07 v2
摘要
测试时适应 (Test-Time Adaptation, TTA) 已成为有效解决 Vision Transformer (ViT) 在无额外训练数据情况下适应分布迁移问题的方案之一。然而,现有 TTA 方法往往导致显著的计算开销,限制了其在资源受限实际场景中的应用。为降低推理成本,插即式标记聚合方法通过合并 ViT 中的冗余标记来减少总处理标记数。虽然计算效率较高,但直接集成到现有 TTA 方法时会引发显著性能下降。我们将此问题形式化为高效测试时适应 (Efficient Test-Time Adaptation, ETTA),旨在在保持 TTA 适应能力的同时降低推理延迟。本文首先从新颖的互信息视角进行理论分析,表明标记聚合本质上会导致信息损失,常规基于范数调谐的 TTA 方法无法完全弥补这一损失。基于此洞见,我们提出了 \textbf{N}eutralize Token \textbf{A}ggregation \textbf{v}ia \textbf{I}nformation \textbf{A}ugmentation (\textbf{NAVIA})。具体而言,我们直接增强 [CLS] 标记嵌入,并在 ViT 的浅层引入自适应偏置。我们理论证明,这些增强通过熵最小化优化可恢复因标记聚合而丢失的信息。广泛的实验结果表明,NAVIA 在各类分布外基准任务上均显著优于最新方法数百分比点,同时实现推理延迟降低超过 20%,有效解决了 ETTA 挑战。
引用
@article{arxiv.2508.03388,
title = {Neutralizing Token Aggregation via Information Augmentation for Efficient Test-Time Adaptation},
author = {Yizhe Xiong and Zihan Zhou and Yiwen Liang and Hui Chen and Zijia Lin and Tianxiang Hao and Fan Zhang and Jungong Han and Guiguang Ding},
journal= {arXiv preprint arXiv:2508.03388},
year = {2025}
}
备注
9 pages, 7 figures