公平对待:视频模型中的帧归因
计算机视觉与模式识别
2020-11-26 v1 机器学习
摘要
本文提出了一种用于解释动作识别模型的归因方法。此类模型通过分数聚合或关系推理融合视频中多帧的信息。我们公平地将模型的类别分数分解为各帧贡献之和。我们的方法将合作博弈中公平奖励分配的公理化解——即 Shapley 值——推广至变长序列中的元素,称之为元素 Shapley 值(Element Shapley Value, ESV)。关键的是,我们提出了一种可处理的 ESV 近似,其计算复杂度随序列中帧数线性增长。我们利用 ESV 在细粒度数据集 Something-Something 上解释两种动作识别模型(TRN 和 TSN)。我们详细分析了支持/干扰帧,以及 ESV 与帧位置、类别预测和序列长度的关系。我们将 ESV 与朴素基线及两种常用的特征归因方法 Grad-CAM 和 Integrated-Gradients 进行比较。
引用
@article{arxiv.2011.12372,
title = {Play Fair: Frame Attributions in Video Models},
author = {Will Price and Dima Damen},
journal= {arXiv preprint arXiv:2011.12372},
year = {2020}
}
备注
Code available at: https://github.com/willprice/play-fair/ and supporting website at: https://play-fair.willprice.dev/