dataRLsec:面向 DPAs 的安全、安全与可靠性的鲁棒离线强化学习
密码学与安全
2026-01-06 v1
摘要
数据投毒攻击 (DPAs) 在人工智能 (AI) 时代变得越来越流行。黑客和渗透测试人员过度向训练数据(以及测试数据)中注入恶意内容,导致难以检查和预测的错误结果。我们分析了从深度强化学习到联邦学习等近期技术用于 DPAs 及其安全、安全与对策。问题设置及其估计在 MuJoCo 环境中展示,HalfCheetah 在数据被投毒前后的性能表现被测量。我们分析了与 DPAs 相关的各种风险,以及从流行投毒数据攻击到流行数据防御在医疗数据中的伪造问题。我们提出了一种鲁棒离线强化学习 (Offline RL) 方法,用于 weighted hash verification 结合 density-ratio 加权行为克隆 (DWBC) 算法。本文描述了 proposed algorithm 的四个阶段(Stage 0、Stage 1、Stage 2、Stage 3),并依据离线 RL、安全和安全性讨论了 DPAs。结论和未来范围旨在将 DWBC 与其他数据防御策略结合,以对抗和保护未来的 contamination 网络攻击。
引用
@article{arxiv.2601.01289,
title = {dataRLsec: Safety, Security, and Reliability With Robust Offline Reinforcement Learning for DPAs},
author = {Shriram KS Pandian and Naresh Kshetri},
journal= {arXiv preprint arXiv:2601.01289},
year = {2026}
}
备注
10 pages, 3 figures