基于策略对齐的非层级多保真度模型设计策略自适应学习
机器学习
2024-11-19 v1 人工智能
摘要
多保真度强化学习(RL)框架显著提高了工程设计效率,通过利用不同准确性和计算成本的分析模型。现有方法以迁移学习、人类启发策略、控制变量技术和自适应抽样为特征,主要依赖于模型的结构化层级。然而,这种对模型层级的依赖忽略了模型在设计空间中异构误差分布的差异,这超出了单纯的保真度层级。本文提出ALPHA(Adaptively Learned Policy with Heterogeneous Analyses),一种新型的多保真度RL框架,通过自适应地利用任意非层级、异构的低保真度模型以及高保真度模型,高效学习高保真度策略。具体而言,低保真度策略及其经验数据会根据其与高保真度策略的对齐程度被动态地用于高效的有针对性的学习。我们在解析测试优化问题和八旋翼机设计问题中展示了ALPHA的有效性,分别使用两个低保真度模型和一个高保真度模型。结果表明,ALPHA具备适应性能力,能够在时间和设计空间上动态利用模型,无需像层级框架那样安排模型。此外,适应性智能体发现更直接的通往高性能解决方案的路径,显示出优于层级智能体的更好收敛性能。
引用
@article{arxiv.2411.10841,
title = {Adaptive Learning of Design Strategies over Non-Hierarchical Multi-Fidelity Models via Policy Alignment},
author = {Akash Agrawal and Christopher McComb},
journal= {arXiv preprint arXiv:2411.10841},
year = {2024}
}
备注
48 pages, 20 figures