利用语言扩展到未见域
计算机视觉与模式识别
2023-05-02 v6
摘要
为视觉模型部署时可能遇到的每个可能域收集训练数据代价高昂。我们转而考虑如何简单地通过语言描述训练域(例如“鸟的照片”)以及我们想要扩展但无数据的域(例如“鸟的画作”)来改善鲁棒性。使用具有图像与语言联合嵌入空间的多模态模型,我们的方法 LADS 学习将图像嵌入从训练域变换到各个未见测试域,同时保留任务相关信息。在无需使用任何来自未见测试域的图像的情况下,我们表明在包含训练域与未见测试域的扩展域上,LADS 在针对域适应和数据集偏差的四个基准测试套件上优于标准微调和集成方法。
引用
@article{arxiv.2210.09520,
title = {Using Language to Extend to Unseen Domains},
author = {Lisa Dunlap and Clara Mohri and Devin Guillory and Han Zhang and Trevor Darrell and Joseph E. Gonzalez and Aditi Raghunathan and Anja Rohrbach},
journal= {arXiv preprint arXiv:2210.09520},
year = {2023}
}