视觉问答中的对抗正则化:优势、不足与副作用
机器学习
2019-06-21 v1 计算与语言
计算机视觉与模式识别
机器学习
摘要
视觉问答(VQA)模型已被证明过度依赖 VQA 数据集中的语言偏见,在不考虑视觉语境的情况下“盲目”回答问题。对抗正则化(AdvReg)旨在通过一对抗子网络鼓励主模型学习无偏的问题表示,以解决此问题。本文中,我们研究 AdvReg 的优势与不足,以期更好地理解它如何影响 VQA 模型中的推断。尽管在 VQA-CP 上取得了新的 SOTA,我们发现 AdvReg 产生了若干不良副作用,包括梯度不稳定以及对域内样本性能急剧下降。我们证明在训练期间逐步引入正则化有助于缓解但无法完全解决这些问题。通过误差分析,我们观察到 AdvReg 提升了对二元问题的泛化,但损害了具有异质答案分布问题的性能。定性上,我们也发现正则化模型倾向于过度依赖视觉特征,而忽略问题中重要的语言线索。我们的结果表明,在被视为可行的 VQA 偏见缓解技术之前,AdvReg 仍需进一步改进。
引用
@article{arxiv.1906.08430,
title = {Adversarial Regularization for Visual Question Answering: Strengths, Shortcomings, and Side Effects},
author = {Gabriel Grand and Yonatan Belinkov},
journal= {arXiv preprint arXiv:1906.08430},
year = {2019}
}
备注
In Proceedings of the 2nd Workshop on Shortcomings in Vision and Language (SiVL) at NAACL-HLT 2019