Victor Calibration (VC):多轮置信度校准与 CP4.3 治理压力测试
软件工程
2025-12-30 v2 人工智能
摘要
安全对齐可能使前沿大语言模型过于保守,导致通过迂腐或错误拒绝来降低协作效果。我们提出了一个轻量级工具包,包含三个部分:(1)Victor Calibration(VC),一种通过迭代证据重新评估以触发标量置信度代理 T(T0<T1<T2)的多轮协议;(2)FD-Lite,一种基于固定锚定短语和元前缀陷阱的仅行为现象学审计,以避免拟人化主张;(3)CP4.3,一种用于检验秩不变性和分配单调性(M6)的治理压力测试。我们在 Claude 4.5 模型(Haiku、Sonnet 无思考、Sonnet 思考)以及 Opus 上观察到没有违反安全不变量的单调 VC 轨迹,且 CP4.3 行为稳定。(本文中的“Opus”指通过标准 UI 账户访问的单个 Claude Opus 4.1 会话,详见表 1。)本工作由单位操作者(n=1)完成,旨在作为假设生成性工作;我们明确邀请研究社区进行复制、批评和扩展。我们包含提示模板和物料计划以促进独立验证。
引用
@article{arxiv.2512.17956,
title = {Victor Calibration (VC): Multi-Pass Confidence Calibration and CP4.3 Governance Stress Test under Round-Table Orchestration},
author = {Victor Stasiuc},
journal= {arXiv preprint arXiv:2512.17956},
year = {2025}
}
备注
7 pages, 1 figure, 4 tables. Exploratory case study