中文

AutoTIR:通过强化学习实现自主工具集成推理

人机交互 2025-08-06 v2

摘要

大型语言模型(LLM)通过推理导向的后训练可进化为强大的大规模推理模型(Large Reasoning Models,LRM)。工具集成推理(TIR)通过纳入外部工具进一步扩展其能力,但现有方法常依赖刚性的、预定义的工具使用模式,风险在于削弱核心语言能力。鼓励人类能够自适应选择工具的能力,我们引入AutoTIR,通过强化学习框架使LLM在推理过程中自主决定是否以及如何调用工具,而非遵循静态的工具使用策略。AutoTIR利用混合奖励机制,同时优化任务特定答案的正确性、结构化输出的遵循性,并对不正确的工具使用进行惩罚,从而鼓励精确推理和高效工具集成。广泛的评估覆盖多样化的知识密集型、数学和通用语言建模任务,表明AutoTIR实现了卓越的整体性能,显著优于基线方法,并在工具使用行为上表现出优异的泛化能力。这些结果凸显了强化学习在构建 truly generalizable and scalable TIR 能力方面的潜力。代码和数据可在 https://github.com/weiyifan1023/AutoTIR 获取。

关键词

引用

@article{arxiv.2507.21837,
  title  = {VeasyGuide: Personalized Visual Guidance for Low-vision Learners on Instructor Actions in Presentation Videos},
  author = {Yotam Sechayk and Ariel Shamir and Amy Pavel and Takeo Igarashi},
  journal= {arXiv preprint arXiv:2507.21837},
  year   = {2025}
}

备注

ASSETS '25, Denver, CO, USA