中文

VLLaVO:利用大语言模型缓解视觉域间隙

计算机视觉与模式识别 2024-03-19 v2 计算与语言 机器学习

摘要

深度学习模型近期取得的进展依赖于独立同分布假设,这阻碍了其在存在域偏移的真实场景中的应用。为解决这一问题,跨域学习旨在提取域不变知识,以减少训练数据与测试数据之间的域偏移。然而,在视觉跨域学习中,传统方法仅关注图像模态,忽视了融入文本模态的潜在益处。在本工作中,我们提出了 VLLaVO,结合视觉语言模型和大语言模型作为视觉跨域学习器。VLLaVO 利用视觉语言模型将图像转换为详细的文本描述,随后在大语言模型上使用由设计的指令模板生成的源域/目标域文本描述进行微调。在域泛化和无监督域适应设置下的大量实验结果证明了所提方法的有效性。

关键词

引用

@article{arxiv.2401.03253,
  title  = {VLLaVO: Mitigating Visual Gap through LLMs},
  author = {Shuhao Chen and Yulong Zhang and Weisen Jiang and Jiangang Lu and Yu Zhang},
  journal= {arXiv preprint arXiv:2401.03253},
  year   = {2024}
}