中文

第五届GCAIAC零样本指代表达理解挑战赛的解决方案

计算机视觉与模式识别 2024-07-09 v1 计算与语言 机器学习

摘要

本报告提出了一种针对零样本指代表达理解任务的解决方案。视觉-语言多模态基础模型(如CLIP、SAM)近年来作为主流研究的基石受到了广泛关注。多模态基础模型的关键应用之一在于其泛化到零样本下游任务的能力。与传统的指代表达理解不同,零样本指代表达理解旨在将预训练的视觉-语言模型直接应用于任务,而无需特定训练。最近的研究通过引入视觉提示,增强了多模态基础模型在指代表达理解任务中的零样本性能。为了解决零样本指代表达理解挑战,我们引入了视觉提示的组合,并考虑了文本提示的影响,根据数据特征采用联合预测。最终,我们的方法在A排行榜上达到了84.825的准确率,在B排行榜上达到了71.460的准确率,获得了第一名。

关键词

引用

@article{arxiv.2407.04998,
  title  = {The Solution for the 5th GCAIAC Zero-shot Referring Expression Comprehension Challenge},
  author = {Longfei Huang and Feng Yu and Zhihao Guan and Zhonghua Wan and Yang Yang},
  journal= {arXiv preprint arXiv:2407.04998},
  year   = {2024}
}