代码世界模型的双重角色:通过执行轨迹暴露恶意行为
机器学习
2026-02-06 v2
摘要
大型语言模型(LLM)越来越多地生成代码,缺乏人工监督,这引发了关于后门注入和恶意行为的严重关切。我们提出了交叉轨迹验证协议(Cross-Trace Verification Protocol, CTVP),这是一种新型的人工智能控制框架,通过语义轨道分析来验证不可信的代码生成模型。与直接执行潜在恶意代码不同,CTVP 利用模型对跨语义等价程序转换的执行轨迹预测进行推断。通过分析这些预测轨迹中的一致性模式,我们检测行为异常,这些异常指示后门的存在。我们的方法引入了对抗鲁棒性配额(Adversarial Robustness Quotient, ARQ),该配额量化了相对于基线生成的验证计算成本,随轨道规模呈指数增长。理论分析建立了信息论界限,表明该方法不可被对手利用——由于基本的空间复杂度约束,敌对方无法通过训练来获得改进。这一工作表明,语义轨道分析为代码生成任务提供了一种理论上有据可依的人工智能控制方法,尽管初始评估中观察到的假阳性率较高,实际部署仍需解决这一问题。
引用
@article{arxiv.2512.13821,
title = {The Double Life of Code World Models: Provably Unmasking Malicious Behavior Through Execution Traces},
author = {Subramanyam Sahoo},
journal= {arXiv preprint arXiv:2512.13821},
year = {2026}
}
备注
13 Pages, A Preprint