深层强化学习智能体的多目标测试:追求多样性
机器学习
2025-10-17 v1
摘要
在安全关键领域测试深度强化学习(DRL)智能体需要发现多样化的失效场景。现有工具如INDAGO仅依赖于单目标优化专注于最大化失效计数,但这并不能确保发现的场景是多样化的或揭示不同错误类型。我们引入INDAGO-Nexus,一种多目标搜索方法,联合优化失效概率和测试场景多样性,使用多目标进化算法配合多种多样性指标和Pareto前沿选择策略。我们在三个DRL智能体上评估了INDAGO-Nexus:人类行走者、自动驾驶汽车和停车智能体。在SDC和停车场景中,INDAGO-Nexus平均比INDAGO发现了最多83%和40%的独特失效(测试有效性),同时在所有智能体中将失效时间缩短了最高67%。
引用
@article{arxiv.2510.14727,
title = {The Pursuit of Diversity: Multi-Objective Testing of Deep Reinforcement Learning Agents},
author = {Antony Bartlett and Cynthia Liem and Annibale Panichella},
journal= {arXiv preprint arXiv:2510.14727},
year = {2025}
}
备注
Pre-print - Accepted at Symposium on Search Based Software Engineering (SSBSE) 2025 co-located with ASE'25