结构意图作为类协议通信层:跨模型鲁棒性、框架比较与弱模型补偿效应
摘要
结构化意图表示能否可靠地在不同的 AI 模型、语言和提示框架之间保存用户目标?先前工作表明,PPS(基于 5W3H 的提示协议规范),可提高中文中的目标对齐,并推广到英文和日文。本文将该研究延伸至三个方向:跨模型鲁棒性(Claude、GPT-4o 和 Gemini 2.5 Pro);与 CO-STAR 和 RISEN 的受控比较;以及在生态有效情境中进行 AI 辅助意图扩展的用户研究( N=50)。在 3,240 个模型输出(3 种语言 x 6 种条件 x 3 个模型 x 3 个领域 x 20 项任务)中,由独立评判员(DeepSeek-V3)进行评估,我们发现结构化提示显著降低了跨语言得分方差相对于非结构化基线。最强的结构化条件将跨语言 sigma 从 0.470 降低至约 0.020。我们还观察到弱模型补偿模式:最低基线模型(Gemini)显示更大的 D-A 增益(+1.006),而最强模型(Claude, +0.217)。在当前评估分辨率下,5W3H、CO-STAR 和 RISEN 实现了相似的高目标对齐得分,表明维度分解本身是一个重要的活跃因子。在用户研究中,AI 扩展的 5W3H 提示将交互轮数减少 60%,用户满意度从 3.16 提升至 4.04。这些发现支持了结构化意图表示作为面向人类-AI 交互的稳健、类协议通信层的实际价值。
引用
@article{arxiv.2603.29953,
title = {Structured Intent as a Protocol-Like Communication Layer: Cross-Model Robustness, Framework Comparison, and the Weak-Model Compensation Effect},
author = {Peng Gang},
journal= {arXiv preprint arXiv:2603.29953},
year = {2026}
}
备注
25 pages, figures, tables, and appendix. Third paper in a cumulative research series on PPS and 5W3H structured intent representation, extending prior work to cross-model robustness, framework comparison, and user-study validation