Theta-Resonance:一种用于设计空间探索的单步强化学习方法
机器学习
2022-11-18 v2 人工智能
摘要
给定一个用于评估指定设计空间中样本的环境(例如模拟器)以及一组加权评估指标——人们可以使用 Theta-Resonance(一种单步马尔可夫决策过程(MDP))来训练一个智能体,以逐步产生更优的样本。在 Theta-Resonance 中,神经网络消耗一个常量输入张量,并生成一组条件概率密度函数(PDF)作为策略,用于对各个设计维度进行采样。我们专门化了深度强化学习(D-RL)中现有的策略梯度算法,以利用评估反馈(以代价、惩罚或奖励的形式)来更新我们的策略网络,具有鲁棒的算法稳定性和最少的设计评估次数。我们在一个简单的 SoC 设计空间的背景下研究了多种神经架构(用于我们的策略网络),并提出了一种构建合成空间探索问题的方法,以比较和改进设计空间探索(DSE)算法。尽管我们仅展示了类别型设计空间,我们也概述了如何使用 Theta-Resonance 来探索连续以及连续-离散混合的设计空间。
引用
@article{arxiv.2211.02052,
title = {Theta-Resonance: A Single-Step Reinforcement Learning Method for Design Space Exploration},
author = {Masood S. Mortazavi and Tiancheng Qin and Ning Yan},
journal= {arXiv preprint arXiv:2211.02052},
year = {2022}
}