基于惩罚无用动作的高效 RL 缓存漏洞探索
密码学与安全
2025-06-10 v1
摘要
缓存时序攻击利用微观架构特征泄露敏感数据,构成现代系统的严重威胁。尽管存在此严重性,但分析给定缓存结构针对缓存时序攻击的漏洞仍具有挑战性。为此,已提出一种基于强化学习 (RL) 的方法,用于自动探索给定缓存结构的漏洞。然而,基于 RL 的方法会因代理执行不 contribute to 探索的动作而导致效率低下。本文提出一种方法,在训练期间识别这些无用动作并对其进行惩罚,以便代理避免它们并提高探索效率。实验在 17 个缓存结构上表明,我们的训练机制可将无用动作数量降低最高可达 43.08%。这导致相对于基于原始 RL 方法的训练时间在基本情况下缩短 28%,在几何平均数下缩短 4.84%。
引用
@article{arxiv.2506.07200,
title = {Efficient RL-based Cache Vulnerability Exploration by Penalizing Useless Agent Actions},
author = {Kanato Nakanishi and Soramichi Akiyama},
journal= {arXiv preprint arXiv:2506.07200},
year = {2025}
}
备注
Presented in Machine Learning for Computer Architecture and Systems (MLArchSys), June 21, 2025