通过强弱引导结合视觉语言模型固有知识与无监督域适应
计算机视觉与模式识别
2024-12-02 v4
摘要
无监督域适应(UDA)试图通过利用带标签的源数据集并将其知识迁移到相似但不同的目标数据集,来克服数据标注的繁琐工作。与此同时,当前的视觉语言模型展现出卓越的零样本预测能力。在这项工作中,我们将通过UDA获得的知识与视觉语言模型的固有知识相结合。我们引入了一种强弱引导学习方案,利用零样本预测来帮助对齐源数据集和目标数据集。对于强引导,我们用目标数据集中最自信的样本来扩充源数据集。此外,我们采用知识蒸馏损失作为弱引导。强引导使用硬标签,但仅应用于目标数据集中最自信的预测。相反,弱引导应用于整个数据集,但使用软标签。弱引导实现为一种带有(偏移)零样本预测的知识蒸馏损失。我们表明,我们的方法补充并受益于视觉语言模型的提示适应技术。我们在三个基准(OfficeHome、VisDA和DomainNet)上进行了实验和消融研究,性能优于最先进的方法。我们的消融研究进一步证明了算法不同组件的贡献。
引用
@article{arxiv.2312.04066,
title = {Combining inherent knowledge of vision-language models with unsupervised domain adaptation through strong-weak guidance},
author = {Thomas Westfechtel and Dexuan Zhang and Tatsuya Harada},
journal= {arXiv preprint arXiv:2312.04066},
year = {2024}
}
备注
Accepted for WACV 2025