中文

Tina:通过 LoRA 实现的微型推理模型

计算与语言 2025-06-13 v1 人工智能 机器学习

摘要

我们如何在语言模型中以经济有效的方式实现强大的推理能力?以此根本性问题为驱动,我们提出 Tina,一套实现高性价比推理能力的微型模型。值得注意的是,Tina 展示了仅通过在强化学习(RL)期间应用于小型 1.5B 参数基础模型的低秩适应(LoRA)参数高效更新,即可开发出大量推理性能。这种极简方法产生的模型在推理性能上与基于相同基础模型构建的现有 SOTA RL 推理模型并驾齐驱,甚至在某些方面超越。关键在于,这是在极小的计算 post-training 成本下实现的,仅需 9 美元 post-training 和评估成本(即约 260 倍的成本降低)。我们的工作揭示了通过 LoRA 实现的高效 RL 推理的惊人效果。我们在多个开源推理数据集和各种消除实验设置下进行了验证,从中一组固定的超参数开始。进一步地,我们假设这种效果和效率源于 LoRA 快速地使模型适应 RL 所奖励的推理结构格式,而基本模型的底层知识基本保持不变。为服务于可访问性和开放研究,我们完全开源所有代码、训练日志和模型权重与检查点。

关键词

引用

@article{arxiv.2504.15777,
  title  = {Tina: Tiny Reasoning Models via LoRA},
  author = {Shangshang Wang and Julian Asilis and Ömer Faruk Akgül and Enes Burak Bilgin and Ollie Liu and Willie Neiswanger},
  journal= {arXiv preprint arXiv:2504.15777},
  year   = {2025}
}