从博弈论视角理解机器学习模型中的重复解释
计算机科学与博弈论
2022-08-24 v2 机器学习
摘要
本文借助博弈论,对由机器学习(ML)模型及其关联解释方法构成的系统与寻求查询/输入的预测/标签及其解释的最终用户之间的策略性重复交互进行了形式化建模。在该博弈中,恶意最终用户必须策略性地决定何时停止查询并尝试攻破系统,而系统必须策略性地决定应向最终用户共享多少信息(以带噪解释的形式)以及何时停止共享,且均不知晓最终用户的类型(诚实/恶意)。本文利用连续时间随机信号博弈框架对这种权衡进行了形式化建模,并刻画了该框架内的马尔可夫完美均衡状态。
引用
@article{arxiv.2202.02659,
title = {A Game-theoretic Understanding of Repeated Explanations in ML Models},
author = {Kavita Kumari and Murtuza Jadliwala and Sumit Kumar Jha and Anindya Maiti},
journal= {arXiv preprint arXiv:2202.02659},
year = {2022}
}
备注
The problem statement has been changed. Thus, the whole paper has been updated. As a result, the previous analysis and the experimental results are inaccurate