研究议程:抵御相关攻击的动态模型
机器学习
2019-03-18 v1 机器学习
摘要
在本文中,我描述了一个在测试时保护机器学习模型免受对抗性输入攻击的研究议程。本文不呈现结果,而是分享我关于该领域所需发展方向的一些思考。现代机器学习在 I.I.D. 数据上表现非常好:每个样本被{\em 独立}抽取且生成每个样本的分布{\em 相同}的数据。当这些假设放宽时,现代机器学习可能表现很差。当机器学习用于安全攸关的场景时,期望设计即使在输入由恶意对手设计的情况下也能表现良好的模型。迄今为止,该方向的大部分研究集中于违反{\em 相同}假设并施加某种受限最坏情况分布偏移的对手。我认为机器学习安全研究者也应解决放宽{\em 独立性}假设的问题,并且当前为分布偏移鲁棒性设计的策略无法做到这一点。我推荐每次运行时都改变的{\em 动态模型}作为该问题的潜在解决路径,并展示一个使用相关数据、可被简单动态防御缓解的简单攻击示例。这并非用作真实世界安全措施,而是作为探索该研究方向并开发更现实防御的建议。
引用
@article{arxiv.1903.06293,
title = {A Research Agenda: Dynamic Models to Defend Against Correlated Attacks},
author = {Ian Goodfellow},
journal= {arXiv preprint arXiv:1903.06293},
year = {2019}
}