中文

探索决策政策的关键测试场景:一种基于大语言模型的方法

机器学习 2024-12-17 v2

摘要

近期决策政策的进展推动了自动驾驶和机器人等领域的显著进展。然而,测试这些政策仍至关重要,因为存在可能威胁其可靠性的关键场景。尽管已有研究,但由于决策政策及其环境的复杂性,仍面临测试效率低和多样性有限等挑战。为此,本文提出一种灵活的大语言模型(LLM)驱动的在线测试框架,用于探索决策政策的关键且多样化的测试场景。具体而言,我们设计了一种“生成-测试-反馈”管道,通过模板化提示工程发挥LLM的世界知识和推理能力。此外,本文提出一种多尺度场景生成策略,以解决LLM在细粒度调整方面的局限性,进一步提升测试效率。最后,在五个广泛认可的基准测试中评估了所提出的LLM驱动方法,实验结果表明,我们的方法在发现关键且多样化场景方面显著优于基线方法。这些发现表明,LLM驱动的方法在推动决策政策的测试方面具有重要潜力。

关键词

引用

@article{arxiv.2412.06684,
  title  = {Exploring Critical Testing Scenarios for Decision-Making Policies: An LLM Approach},
  author = {Weichao Xu and Huaxin Pei and Jingxuan Yang and Yuchen Shi and Yi Zhang and Qianchuan Zhao},
  journal= {arXiv preprint arXiv:2412.06684},
  year   = {2024}
}

备注

16 pages, 13 figures