通过向同伴学习改进选择性视觉问答
计算机视觉与模式识别
2023-06-16 v1
摘要
尽管视觉问答(VQA)取得了进展,但模型评估自身正确性的能力仍未被充分探索。近期研究表明,开箱即用的VQA模型在出错时可能难以放弃回答。放弃回答的选项(也称为选择性预测)在将系统部署给必须信任系统输出的用户(例如,面向视觉障碍用户的VQA助手)时高度相关。对于此类场景,放弃回答尤为重要,因为用户可能提供分布外(OOD)或对抗性输入,使错误回答更有可能发生。在本工作中,我们探索了分布内(ID)和OOD场景下的选择性VQA,其中模型面临ID与OOD数据的混合。目标是在最大化已回答问题数量的同时,最小化这些问题上的错误风险。我们提出了一种简单而有效的“向同伴学习”(LYP)方法,用于训练多模态选择函数以做出放弃决策。我们的方法使用在训练数据不同子集上训练的模型的预测作为优化选择性VQA模型的目标。它不需要额外的手动标注或留出数据,并提供了识别易于/难以泛化样本的信号的信号。在我们广泛的评估中,我们表明这有益于多种不同架构和规模的模型。总体而言,在ID下,我们在1%错误风险下的选择性预测指标覆盖率(C@1%)达到32.92%,是该任务上此前最佳覆盖率15.79%的两倍。对于混合ID/OOD,使用模型的softmax置信度进行放弃决策表现非常差,即使在仅面对10% OOD样本时,在1%错误风险下回答的问题也少于5%,但采用LYP的学习型选择函数可将其提升至25.38% C@1%。
引用
@article{arxiv.2306.08751,
title = {Improving Selective Visual Question Answering by Learning from Your Peers},
author = {Corentin Dancette and Spencer Whitehead and Rishabh Maheshwary and Ramakrishna Vedantam and Stefan Scherer and Xinlei Chen and Matthieu Cord and Marcus Rohrbach},
journal= {arXiv preprint arXiv:2306.08751},
year = {2023}
}
备注
CVPR 2023. Code available here: https://github.com/facebookresearch/selective-vqa_ood