强化学习的可重用测试套组
软件工程
2025-09-01 v1
摘要
强化学习(RL)代理在解决序列决策任务方面显示出巨大的潜力。然而,验证代理策略行为在部署时的可靠性和性能仍然具有挑战性。大多数强化学习策略测试方法会生成针对被测试的代理策略量身定制的测试套组,其对其他策略的相关性尚不明确。本工作提出了多策略测试用例选择(Multi-Policy Test Case Selection, MPTCS),这是一种用于 RL 环境的新型自动化测试套组选择方法,旨�从任何基于可解性、多样性和通用难度生成的测试用例中提取测试用例。MPTCS 使用一组策略来选择一组多样化的、可重用的与策略无关的测试用例,以揭示代理行为中典型缺陷。该策略集合从候选池中选择测试用例,该候选池可以由任何策略测试方法生成,基于难度得分。我们评估了难度得分的有效性以及该方法的有效性和成本如何取决于策略组中的策略数量。此外,还 examined一种促进测试套组多样性的方法——一种受质量-多样性算法启发的离散化通用测试用例描述表面——以确定其覆盖状态空间的方式以及哪些策略会产生故障行为。
引用
@article{arxiv.2508.21553,
title = {Reusable Test Suites for Reinforcement Learning},
author = {Jørn Eirik Betten and Quentin Mazouni and Dennis Gross and Pedro Lind and Helge Spieker},
journal= {arXiv preprint arXiv:2508.21553},
year = {2025}
}