中文

LLM的摩擦性策略优化:认识干预、风险敏感控制与反思对齐

计算与语言 2026-04-29 v1 人工智能 机器学习

摘要

我们提出了摩擦性策略优化(FPO)框架,用于学习能够控制不仅要说什么,还要何时以及如何干预的语言模型策略,以管理认识风险和规范风险。不同于优化表面级偏好或任务效用的标准对齐方法,FPO将澄清、验证、挑战、重定向和拒绝视为显式的控制动作,其目的是塑造信念、承诺和不确定性随时间的演变。我们将对齐建模为一种风险敏感的认识控制问题,其中干预决策是根据其对下游认识质量的预期效果进行选择的,而不仅仅是基于即时奖励。我们引入了一套摩擦干预的紧凑分类学,一个结构化的摩擦功能,用于操作化多种对齐失效模式,并提出了一系列统一的FPO方法,涵盖奖励塑形、偏好配对、群体相对排序和风险条件信任区域。我们进一步提出了一个评估框架,直接通过澄清行为、校准、矛盾修复、拒绝比例和信息效率来衡量认识能力。总体而言,这些结果为学习在结果层面上以及认识行为层面上都对齐的智能体提供了形式化和算法化的基础。

关键词

引用

@article{arxiv.2604.25136,
  title  = {Frictive Policy Optimization for LLMs: Epistemic Intervention, Risk-Sensitive Control, and Reflective Alignment},
  author = {James Pustejovsky and Nikhil Krishnaswamy},
  journal= {arXiv preprint arXiv:2604.25136},
  year   = {2026}
}

备注

Frictive Policy Optimization; epistemic alignment; risk-sensitive control; LLM alignment; clarification and refusal; preference learning; trust regions; dialogue agents