中文

自适应约束传播:通过元强化学习扩展大语言模型的结构推理

计算与语言 2026-01-27 v3

摘要

大型语言模型日益需要结构化推理,从JSON模式强制到多语言解析,其中输出必须满足复杂约束。我们引入MetaJuLS,一种元强化学习方法,可学习适用于跨语言和跨任务的通用约束传播策略,无需任务特定 retraining。通过将结构化推理形式化为自适应约束传播并使用元学习训练图注意力网络,MetaJuLS在保持与最先进解析器相近0.2%精度的同时,以1.5--2.0倍速度提升GPU优化基线性能。在Universal Dependencies跨10种语言以及LLM约束生成(LogicBench、GSM8K-Constrained)上,MetaJuLS演示出快速跨域适应:在英语解析上训练的策略只需5--10个梯度步骤(5--15秒)即可适应新语言和新任务,而无需数小时的任务特定训练。机制分析揭示,策略发现人类类似的解析策略(easy-first)和新颖的非直觉启发式方法。通过减少LLM部署中的传播步骤,MetaJuLS通过直接降低推理碳足迹为Green AI做出贡献。

关键词

引用

@article{arxiv.2601.00095,
  title  = {Adaptive Constraint Propagation: Scaling Structured Inference for Large Language Models via Meta-Reinforcement Learning},
  author = {Ibne Farabi Shihab and Sanjeda Akter and Anuj Sharma},
  journal= {arXiv preprint arXiv:2601.00095},
  year   = {2026}
}