中文

面向结构导向LLM推理的比例感知适配器

人工智能 2026-05-25 v3 机器学习

摘要

大型语言模型(LLM)正在实现对2D和3D结构的推理,但现有方法仍具有局限性:这些方法通常通过基于序列的分词或固定长度查询连接器压缩结构输入,要么忽略几何 grounding 以缓解结构幻觉,要么引入刚性的模态融合瓶颈,导致结构token被过度压缩且分配不够最优,从而阻碍了通用全原子推理的实现。我们引入Cuttlefish,一个统一的多模态LLM,通过几何线索实现语言推理的几何 grounding。首先,比例感知分块(Scaling-Aware Patching)利用指令条件化门控机制在结构图上生成可变大小的分块,适应性地调整查询token预算以与结构复杂度匹配,从而缓解固定长度连接器的瓶颈。其次,几何 grounding Adapter通过跨注意力机制对这些自适应token进行细化,并将所得模态token注入LLM,向其显式暴露几何线索以减少结构幻觉。跨领域的全原子基准测试表明,Cuttlefish在异构结构导向推理中实现了卓越的性能。代码: github.com/zihao-jing/Cuttlefish。

关键词

引用

@article{arxiv.2602.02780,
  title  = {Scaling-Aware Adapter for Structure-Grounded LLM Reasoning},
  author = {Zihao Jing and Qiuhao Zeng and Ruiyi Fang and Yan Yi Li and Yan Sun and Boyu Wang and Pingzhao Hu},
  journal= {arXiv preprint arXiv:2602.02780},
  year   = {2026}
}

备注

Accepted by ICML 2026