中文

基于 LLM 多模态推理的视觉语义算术

人工智能 2026-04-22 v1

摘要

强化学习(RL)作为后训练对于增强大型语言模型(LLM)在编程和数学方面的推理能力至关重要。然而,它们在视觉语义算术方面的能力,即从图像中推断关系,仍未被充分探索。经典的文本类比“king”-“man”+“woman”=“queen”说明了关系推理,但用“king”和“man”的图像替换文本会显著降低性能,因为这需要常识知识以及从无关视觉细节中提取简洁概念。这种能力对于非结构化环境中的服务和家庭机器人非常重要,因为机器人必须推断物体、智能体和动作之间的语义关系。在厨房中,从图像中识别出“powder”和“cake”通过“is made of”相关联,将符号关系建立在感知基础上,从而实现工具替换、任务泛化和改进的语义推理。先前的工作通过对向量算术后的图像特征进行解码来处理语义算术,但存在模态鸿沟且缺乏系统评估。在本文中,我们提出了两个新任务:二项减法和三项运算,并构建了 Image-Relation-Pair Dataset (IRPD) 用于基准测试。我们进一步提出了 Semantic Arithmetic Reinforcement Fine-Tuning (SAri-RFT),它使用可验证函数和 Group Relative Policy Optimization (GRPO) 对大型视觉语言模型(LVLM)进行后训练。我们的方法在 IRPD 和真实世界 Visual7W-Telling 数据集上取得了 state-of-the-art 的结果。通过赋予 LVLM 鲁棒的跨模态关系推理能力,这项工作提升了家庭机器人将符号推理建立在感知基础上的能力,增强了复杂环境中的决策、工具适应性和人机交互。数据集和源代码在补充材料中提供。

关键词

引用

@article{arxiv.2604.19567,
  title  = {Multi-modal Reasoning with LLMs for Visual Semantic Arithmetic},
  author = {Chuou Xu and Liya Ji and Qifeng Chen},
  journal= {arXiv preprint arXiv:2604.19567},
  year   = {2026}
}