从字面到自由:面向大语言模型的人类对齐例外处理的元提示框架
人工智能
2025-10-16 v1 计算与语言
机器学习
摘要
大型语言模型(LLMs)正日益被部署作为智能体 AI 系统的推理引擎,但它们存在一个关键缺陷:对明确规则的僵化遵守,导致决策偏离人类常识和意图。这“规则僵化”是构建可信赖自主智能体的重要障碍。虽然先前的工作表明,利用人类解释进行的监督微调(SFT)可缓解此问题,但 SFT 计算成本高昂,许多实践者难以访问。为弥补这一差距,我们引入了规则-意图区分(RID)框架,这是一种新型的低计算元提示技术,旨在以零样本方式从 humans 中引出人类对齐的例外处理。RID 框架为模型提供了结构化的认知模式,用于分解任务、分类规则、权衡冲突结果并为最终决策提供依据。我们在包含 20 个需要跨领域细致判断情景的自定义基准测试上评估了 RID 框架,对抗基线和链式思考(CoT)提示。我们的经人类验证的结果表明,RID 框架显著提升了性能,在人类对齐得分(HAS)上达到 95%,而基线为 80%,CoT 为 75%。此外,它始终产生更高质量、以意图为导向的推理。本 work 提出了一种实用、可访问且有效的方法,将大语言模型从字面指令遵循引向自由、以目标为导向的推理,为更可靠、务实的 AI 智能体铺平了道路。
引用
@article{arxiv.2510.12864,
title = {From Literal to Liberal: A Meta-Prompting Framework for Eliciting Human-Aligned Exception Handling in Large Language Models},
author = {Imran Khan},
journal= {arXiv preprint arXiv:2510.12864},
year = {2025}
}
备注
13 pages. Code and data are available at https://github.com/strongSoda/LITERAL-TO-LIBERAL