基于提示的图像语义信息解耦多模态视觉理解
计算机视觉与模式识别
2023-05-17 v1 人工智能
计算与语言
摘要
带有提示的图像多模态视觉理解涉及利用多种视觉与文本线索来增强图像的语义理解。该方法结合视觉与语言处理,以生成更准确的图像预测与识别。通过基于提示的技术,模型可学习聚焦于图像的特定特征,从而为下游任务提取有用信息。此外,多模态理解可通过提供更鲁棒的图像表征来改进单模态模型。总体而言,视觉与文本信息的结合是推进图像识别与理解的一个有前景的研究方向。在本文中,我们将尝试多种提示设计方法,并提出一种用于更好提取语义信息的新方法。
引用
@article{arxiv.2305.09333,
title = {Multi-modal Visual Understanding with Prompts for Semantic Information Disentanglement of Image},
author = {Yuzhou Peng},
journal= {arXiv preprint arXiv:2305.09333},
year = {2023}
}
备注
8 pages