面向开放词汇域适应的提示集成自训练
计算机视觉与模式识别
2023-06-30 v1
摘要
传统域适应假设源域和目标域具有相同的词汇表,在处理具有不同词汇表的目标域时往往面临迁移灵活性与效率有限的问题。受近期视觉-语言模型(VLM)的启发,其通过图像与文本上的推理实现开放词汇视觉识别,我们研究开放词汇域适应(OVDA),这是一种新的无监督域适应框架,将预训练 VLM 作为源模型并将其迁移至任意无标签目标域。为此,我们设计了一种提示集成自训练(PEST)技术,利用视觉与语言之间的协同作用同时缓解图像与文本分布中的域差异。具体而言,PEST 利用了视觉与语言模态内部及跨模态多个提示的互补特性,从而能够联合利用视觉与语言信息并有效学习无标签目标域中的图像-文本对应关系。此外,PEST 通过时序提示集成捕获时间信息,有助于记忆先前学习的目标信息。大量实验表明,PEST 在 10 个图像识别任务上持续优于最先进水平。
引用
@article{arxiv.2306.16658,
title = {Prompt Ensemble Self-training for Open-Vocabulary Domain Adaptation},
author = {Jiaxing Huang and Jingyi Zhang and Han Qiu and Sheng Jin and Shijian Lu},
journal= {arXiv preprint arXiv:2306.16658},
year = {2023}
}