中文

Diversify, Rationalize, and Combine: 用于零样本知识基础 VQA 的多样化、理性化与组合集成

计算与语言 2024-10-10 v5

摘要

知识基础视觉问答(K-VQA)通常需要利用图像之外的背景知识。然而,我们发现单一的知识生成策略往往不足以覆盖所有 K-VQA 问题。为此,我们提出 Diversification, Evidence Truncation, and Combination for Knowledge-based Elucidation(DietCoke),该方法利用一组互补的问答策略,并通过文本理由对答案进行聚合。DietCoke 包含三个阶段:多样化、理性化和集成。多样化阶段生成三个不同的决策上下文,每个上下文产生自己的答案候选。理性化阶段使用解耦技术为每个答案候选生成两个理由:自动理由和机制理由。最后,在集成阶段中,由 LLM 基于理由从三个候选答案中选择一个答案。实验表明,DietCoke 在 OK-VOA 上显著优于最先进的基于 LLM 的基线方法提升 2.8%,在 A-OKVOA 上提升 4.7%,且集成中的策略高度互补。代码已公开:https://github.com/limiaoyu/DietCoke

关键词

引用

@article{arxiv.2406.12746,
  title  = {Diversify, Rationalize, and Combine: Ensembling Multiple QA Strategies for Zero-shot Knowledge-based VQA},
  author = {Miaoyu Li and Haoxin Li and Zilin Du and Boyang Li},
  journal= {arXiv preprint arXiv:2406.12746},
  year   = {2024}
}

备注

Accepted to Findings of EMNLP2024