MIST-RL:基于强化学习的突变式递增测试套件
人工智能
2026-03-03 v1 多智能体系统
社会与信息网络
摘要
大型语言模型(LLM)常常在首次生成代码时即会出现错误,需借助生成的单元测试作为验证手段来验证解决方案。尽管近期验证方法取得了成功,但仍受制于“数量扩张”范式。这种粗暴的做法存在严重局限: faults 检测报酬递减,同时导致严重的测试冗余。为此,我们提出 MIST-RL(Mutation-based Incremental Suite Testing via Reinforcement Learning),一个框架将注意力从“数量扩张”转向“效用扩张”。我们将测试生成形式化为通过 Group Relative Policy Optimization(GRPO)优化的序列决策过程。具体而言,我们引入新颖的递增突变奖励机制结合动态惩罚,激励模型发现新故障的同时抑制功能等价断言。基于 HumanEval+ 和 MBPP+ 的实验表明,MIST-RL 在 state-of-the-art 基准方法上取得优异表现。它在突变得分上提升 28.5%,同时将测试用例数量降低 19.3%。进一步,我们展示这些紧凑高效用的测试用例作为更优验证器,可使 HumanEval+ 上的下游代码重新排序准确率在10个候选样本下提升 3.05%。附录中提供了源代码和数据。
引用
@article{arxiv.2603.01407,
title = {The Observer-Situation Lattice: A Unified Formal Basis for Perspective-Aware Cognition},
author = {Saad Alqithami},
journal= {arXiv preprint arXiv:2603.01407},
year = {2026}
}
备注
Extended version of the AAMAS 2026 paper with the same title