别对我撒谎:利用STEALTH规避恶意解释
软件工程
2023-01-26 v1 人工智能
密码学与安全
摘要
STEALTH 是一种使用某些 AI 生成模型而不遭受恶意攻击(即撒谎)或相关不公平问题的方法。在递归双聚类数据之后,STEALTH 系统就类标签向 AI 模型查询有限次数。STEALTH 仅查询极少次数(每个数据簇 1 次),使得恶意算法(a)无法察觉其运行,且(b)不知何时该撒谎。
引用
@article{arxiv.2301.10407,
title = {Don't Lie to Me: Avoiding Malicious Explanations with STEALTH},
author = {Lauren Alvarez and Tim Menzies},
journal= {arXiv preprint arXiv:2301.10407},
year = {2023}
}
备注
6 pages, 6 Tables, 3 figures