中文

基于链思的策略感知智能体对齐 (PA3)

计算与语言 2026-03-24 v2 人工智能 机器学习

摘要

驱动大型语言模型 (LLM) 的对话式助手在工具使用任务中表现出色,但在遵循复杂企业特定规则方面存在困难。虽然模型能够在上下文中对业务规则进行推理,但为每个查询包含所有政策会导致高延迟和计算资源浪费。此外,这些冗长的提示会导致长上下文,损害整体性能。为解决这些挑战,我们提出一种多阶段对齐方法,教会模型在推理时无需在上下文中包含完整业务政策,即可在链思推理期间调用和应用相关业务政策。我们还引入了基于 Jaccard 评分的 PolicyRecall 奖励以及用于 GRPO 训练的幻觉惩罚。总体而言,我们的最佳模型相较于基线提升了 16 分,相较于相同模型规模的 comparable in-context 基线提升 3 分,同时使用 40% 更少的词数。

关键词

引用

@article{arxiv.2603.14602,
  title  = {PA3: Policy-Aware Agent Alignment through Chain-of-Thought},
  author = {Shubhashis Roy Dipta and Daniel Bis and Kun Zhou and Lichao Wang and Benjamin Z. Yao and Chenlei Guo and Ruhi Sarikaya},
  journal= {arXiv preprint arXiv:2603.14602},
  year   = {2026}
}