强化学习中面向故障多样性的测试
软件工程
2024-03-25 v1
摘要
强化学习是处理序列决策问题的首要技术,包括驾驶汽车和着陆航天器等复杂任务。在软件验证与确认实践中,针对功能性故障检测的测试是建立学习决策模型可信度的一种便捷方法。尽管近期工作旨在最大化检测到的故障数量,但没有一个在搜索过程中考虑故障表征以寻求更多多样性。我们认为,策略测试不应寻找尽可能多的失败案例(例如,触发类似车祸的输入),而应旨在揭示模型中尽可能信息丰富且多样化的故障。本文探索使用质量多样性优化来解决策略测试中的故障多样性问题。质量多样性(QD)优化是一种进化算法,用于解决寻求高质量多样化解决方案的困难组合优化问题。我们定义并解决了将 QD 优化适配到动作策略测试的潜在挑战。此外,我们在搜索效率和故障多样性方面,将经典的 QD 优化器与专用于策略测试的最新框架进行了比较。我们表明,QD 优化虽然在概念上简单且普遍适用,但能有效地在决策模型中找到更多样化的故障,并得出结论:基于 QD 的策略测试是一种有前景的方法。
引用
@article{arxiv.2403.15065,
title = {Testing for Fault Diversity in Reinforcement Learning},
author = {Quentin Mazouni and Helge Spieker and Arnaud Gotlieb and Mathieu Acher},
journal= {arXiv preprint arXiv:2403.15065},
year = {2024}
}
备注
11 pages, 4 figures, 1 algorithm, AST @ ICSE 2024