VQA 模型中注意力模式向自然语言的零样本迁移
计算机视觉与模式识别
2023-11-10 v1 人工智能
计算与语言
摘要
将模型内部转换为文本可产出关于模型的人类可理解洞察。受近期无训练图像字幕方法成功的启发,我们提出 ZS-A2T,一种零样本框架,可将给定模型的 transformer 注意力翻译为自然语言而无需任何训练。我们在视觉问答(VQA)背景下考虑此问题。ZS-A2T 构建于预训练大语言模型(LLM)之上,该模型以任务提示、问题和预测答案为输入。引导 LLM 选择描述 VQA 模型所关注输入图像区域的词元。关键的是,我们通过利用底层 VQA 模型的文本-图像匹配能力来确定此相似性。我们的框架无需任何训练,并允许不同引导源(例如归因而非注意力图)或语言模型的即插即用替换。我们在 VQA 的文本解释数据集上评估这一新任务,在 GQA-REX 和 VQA-X 的零样本设定上取得最先进性能。我们的代码见于:https://github.com/ExplainableML/ZS-A2T。
引用
@article{arxiv.2311.05043,
title = {Zero-shot Translation of Attention Patterns in VQA Models to Natural Language},
author = {Leonard Salewski and A. Sophia Koepke and Hendrik P. A. Lensch and Zeynep Akata},
journal= {arXiv preprint arXiv:2311.05043},
year = {2023}
}
备注
Published in GCPR 2023