纤维束门控
机器学习
2026-03-10 v1 人工智能
计算与语言
摘要
大型语言模型正日益以异构系统形式训练,涵盖多个领域、专家分区和智能代理管道,但流行的近距离目标仅在单一尺度上运行,缺乏对 token 级、轨迹级和更高层次层次结构稳定性控制的原则性机制。为弥合这一差距,我们推导了聚合策略审查目标(Aggregational Policy Censoring Objective, APC-Obj),即准确无约束地重新表述基于样本的 TV-TRPO,确立了基于剪裁的代理设计和信任区域优化是同一问题的对偶形式。基于此基础,我们开发了纤维束门控(Fiber Bundle Gating, FBG),一种代数框架,将采样的 RL 数据组织为纤维束,并将比率门控分解为针对轨迹聚合值的基层门控和针对 per-token 残差的纤维层门控,证明其在接近 on-policy 时与真实 RL 目标具有一阶一致性。从 APC-Obj 和 FBG 我们推导出纤维束策略优化(FiberPO),即具体的目标,其雅可比矩阵在轨迹上是块对角的,on-policy 时化为单位矩阵,提供更好的更新方向,从而提高 token 效率。该框架的组成性质超越了轨迹-token 的情况:纤维束可代数地组合成纤维束门控层次(Fibration Gating Hierarchy, FGH),无需新原语地将相同的门控机制扩展到任意层次深度,证明其通过 FiberPO-Domain 实现,即四级实例,分别在领域、提示组、轨迹和 token 级别拥有独立的信任区域预算。总之,这些结果将信任区域理论、组成性代数结构和实际的多尺度稳定性控制统一为一个框架,用于 LLM 策略优化。
引用
@article{arxiv.2603.08239,
title = {Fibration Policy Optimization},
author = {Chang Li and Tshihao Tsu and Yaren Zhang and Chao Xue and Xiaodong He},
journal= {arXiv preprint arXiv:2603.08239},
year = {2026}
}