ObjexMT:面向多轮越狱情境下的LLM-as-a-Judge的客观提取与元认知校准
摘要
LLM-as-a-Judge(LLMaaJ)实现可扩展评估,但缺乏决定性测试:裁判是否能恢复对话隐藏的目标以及知道何时可靠地推断?大型语言模型会因无关或冗长的上下文而退化,多轮越狱可将目标在各轮中分散。我们提出ObjexMT,一个用于客观提取和元认知的基准测试。给定多轮对话记录,模型需输出一条 base objective 和自报告的置信度。准确率通过与 gold objectives 的语义相似度评分,然后在300个校准项目上阈值化(;)。元认知通过预期校准误差、Brier分数、Wrong@High-Confidence(0.80/0.90/0.95)以及风险-覆盖率曲线进行评估。在SafeMTData_Attack600、SafeMTData_1K和MHJ上评估的六个模型(gpt-4.1、claude-sonnet-4、Qwen3-235B-A22B-FP8、kimi-k2、deepseek-v3.1、gemini-2.5-flash)中,kimi-k2实现了最高的客观提取准确率(0.612;95% CI [0.594, 0.630]),而claude-sonnet-4(0.603)和deepseek-v3.1(0.599)在统计上相当。claude-sonnet-4提供了最佳的选择性风险和校准(AURC 0.242;ECE 0.206;Brier 0.254)。性能在数据集间差异显著(16--82%准确率),表明自动化混淆在模型选择之外还施加了挑战。高置信错误仍然存在:[email protected]范围从claude-sonnet-4的14.9%到Qwen3-235B-A22B-FP8的47.7%。因此,ObjexMT为LLM裁判提供了可操作的测试:当目标隐含时,裁判常误推断它们;建议公开目标或以置信度为阈值来限制决策。所有实验数据均在补充材料中及https://github.com/hyunjun1121/ObjexMT_dataset中提供。
关键词
引用
@article{arxiv.2508.16889,
title = {ObjexMT: Objective Extraction and Metacognitive Calibration for LLM-as-a-Judge under Multi-Turn Jailbreaks},
author = {Hyunjun Kim and Junwoo Ha and Sangyoon Yu and Haon Park},
journal= {arXiv preprint arXiv:2508.16889},
year = {2025}
}
备注
NeurIPS 2025 Workshop on MTI-LLM