中文

RaTA-Tool:基于检索的多模态大语言模型工具选择

计算机视觉与模式识别 2026-04-17 v1 人工智能 计算与语言 多媒体

摘要

基于基础模型的工具学习旨在赋予 AI 系统调用外部资源(如 API、计算工具和专用模型)的能力,以解决超出独立语言生成范围之外的复杂任务。尽管大语言模型(LLM)和多模态大语言模型(MLLM)的最新进展扩展了它们的推理和感知能力,但现有的工具使用方法主要局限于纯文本输入和封闭世界设定。因此,它们难以解释多模态用户指令,并且无法泛化到训练中未见过的工具。在这项工作中,我们引入了 RaTA-Tool,一个用于开放世界多模态工具选择的新颖框架。我们的方法不是学习从用户查询到固定工具标识符的直接映射,而是使 MLLM 能够将多模态查询转换为结构化任务描述,随后通过将该表示与语义丰富的、机器可读的工具描述进行匹配来检索最合适的工具。这种基于检索的公式自然支持扩展到新工具而无需重新训练。为了进一步改善任务描述与工具选择之间的对齐,我们引入了一个基于直接偏好优化(DPO)的偏好优化阶段。为了支持该设定下的研究,我们还引入了第一个用于开放世界多模态工具使用的数据集,其中包含源自 Hugging Face 模型卡的标准化工具描述。大量实验表明,我们的方法显著提高了工具选择性能,特别是在开放世界、多模态场景中。

关键词

引用

@article{arxiv.2604.14951,
  title  = {RaTA-Tool: Retrieval-based Tool Selection with Multimodal Large Language Models},
  author = {Gabriele Mattioli and Evelyn Turri and Sara Sarto and Lorenzo Baraldi and Marcella Cornia and Lorenzo Baraldi and Rita Cucchiara},
  journal= {arXiv preprint arXiv:2604.14951},
  year   = {2026}
}

备注

ICPR 2026