Q&A Prompts:通过挖掘问答提示为需要多样世界知识的视觉问答发现丰富视觉线索
计算机视觉与模式识别
2024-10-15 v5 人工智能
计算与语言
摘要
随着多模态大语言模型的突破,回答需要高级推理能力和世界知识的复杂视觉问题已成为开发 AI 模型比以往重要得多的测试平台。然而,由于人类的认知机制尚未被系统理解,为 AI 模型配备鲁棒的跨模态推理能力仍具挑战。在本文中,我们相信如果能尽可能多地收集给定图像中的视觉线索,我们将更准确地识别图像,更好地理解问题,更轻松地回忆相关知识,并最终推理出答案。我们通过挖掘图像中的问答对并将其作为提示发送到多模态大语言模型中来发现这些丰富的视觉线索。我们将提出的方法称为 Q&A Prompts。具体而言,我们首先使用训练集中的图像-答案对及相应的问题作为输入和输出,训练一个视觉问题生成模型。然后,我们使用图像标注模型识别各种实例,并将打包的图像-标签对发送到视觉问题生成模型中,以提取的图像标签作为答案生成相关问题。最后,我们使用视觉感知提示模块将这些生成的问答对编码为提示,并将其发送到预训练的多模态大语言模型中以推理出最终答案。实验结果表明,与 SOTA 方法相比,我们的 Q&A Prompts 在需要对多样世界知识进行推理的具有挑战性的视觉问答数据集(如 OK-VQA 和 A-OKVQA)上取得了显著提升。
引用
@article{arxiv.2401.10712,
title = {Q&A Prompts: Discovering Rich Visual Clues through Mining Question-Answer Prompts for VQA requiring Diverse World Knowledge},
author = {Haibo Wang and Weifeng Ge},
journal= {arXiv preprint arXiv:2401.10712},
year = {2024}
}
备注
Accepted by ECCV'24