LPF:一种用于去偏视觉问答的语言先验反馈目标函数
计算机视觉与模式识别
2021-06-24 v2 计算与语言
摘要
大多数现有视觉问答(VQA)系统往往过度依赖语言偏置,从而无法从视觉线索进行推理。为解决此问题,我们提出一种新颖的语言先验反馈(LPF)目标函数,以重新平衡每个答案损失值在总 VQA 损失中的占比。LPF 首先利用仅问句分支计算调制因子以确定语言偏置。随后,LPF 在训练过程中为各训练样本分配自适应权重。借助该重加权机制,LPF 确保总 VQA 损失可被重塑为更均衡的形式。由此,那些需要特定视觉信息来预测的样本将在训练中得到高效利用。我们的方法实现简单、与模型无关且可端到端训练。我们进行了大量实验,结果表明 LPF (1) 在各种 VQA 模型上带来显著提升,(2) 在偏置敏感的 VQA-CP v2 基准上取得有竞争力的性能。
引用
@article{arxiv.2105.14300,
title = {LPF: A Language-Prior Feedback Objective Function for De-biased Visual Question Answering},
author = {Zujie Liang and Haifeng Hu and Jiaying Zhu},
journal= {arXiv preprint arXiv:2105.14300},
year = {2021}
}
备注
Accepted by ACM SIGIR 2021