基于有界熵最小化的多标签测试时自适应
计算机视觉与模式识别
2025-02-07 v1
摘要
主流的测试时自适应(TTA)技术致力于通过熵最小化来缓解多类分类中的分布偏移,这本质上会增加最置信类别的概率。然而,当遇到多标签实例时,主要挑战源于每张图像标签数量的变化,仅优先考虑最高概率的类别不可避免地会损害其他正标签的自适应。为了解决这个问题,我们研究了多标签场景下的 TTA(ML--TTA),开发了有界熵最小化(BEM)目标,以同时提高多个最高预测标签的置信度。具体来说,为了确定每个增强视图的标签数量,我们检索一个配对的描述文本,该文本为该视图生成了文本标签。这些标签被分配给视图和描述文本,分别称为弱标签集和强标签集,两者大小均为 k。随后,所提出的 BEM 将视图和描述文本中预测概率最高的前 k 个标签分别视为一个整体,同时学习视图和描述文本的提示。通过绑定前 k 个预测标签,BEM 克服了传统熵最小化仅优化最置信类别的局限性。在 MSCOCO、VOC 和 NUSWIDE 多标签数据集上,我们配备 BEM 的 ML-TTA 框架在各种模型架构、提示初始化和不同标签场景下,均展现出优于最新 SOTA 方法的性能。代码可在 https://github.com/Jinx630/ML-TTA 获取。
引用
@article{arxiv.2502.03777,
title = {Multi-Label Test-Time Adaptation with Bound Entropy Minimization},
author = {Xiangyu Wu and Feng Yu and Qing-Guo Chen and Yang Yang and Jianfeng Lu},
journal= {arXiv preprint arXiv:2502.03777},
year = {2025}
}
备注
Accepted for publication at ICLR 2025; 17 pages; 3 figures