让机器人梦见电气羊:基于人类启发的图像语义理解与推理框架
计算机视觉与模式识别
2025-12-25 v2 人工智能
计算机与社会
摘要
图像隐喻理解仍是 AI 系统面临的关键挑战,因现有模型难以把握视觉内容中嵌入的细腻文化、情感与情境隐含意义。虽然多模态大型语言模型 (MLLMs) 在通用视觉问答 (VQA) 任务中表现出色,但在图像语义任务中仍面临根本性局限:情境缺失导致不同视觉元素及其抽象含义之间的关系难以明确。致力于人类认知过程的启发,我们提出 Let Androids Dream (LAD),一种用于图像语义理解与推理的新型框架。LAD 通过三阶段框架解决情境缺失问题:(1) 感知阶段:将视觉信息转化为丰富且多层次的文本表征;(2) 搜索阶段:迭代搜索并整合跨领域知识以消除歧义;(3) 推理阶段:通过显式推理生成情境对齐的图像语义。我们的框架采用轻量级 GPT-4o-mini 模型,在英语图像语义基准测试中实现 15+ 项 MLLMs 的 SOTA 性能,并在中文基准测试中取得显著提升, 在多选问 (MCQ) 上与 Gemini-3.0-pro 模型持平,在开放式问 (OSQ) 上超越 GPT-4o 模型 36.7%。泛化实验也表明,该框架能有效提升通用 VQA 和视觉推理任务。此外,我们的工作为 AI 更有效地解释图像语义提供了新见解,推动了视觉语言推理与人机交互领域的发展。项目已公开于 https://github.com/MING-ZCH/Let-Androids-Dream-of-Electric-Sheep
引用
@article{arxiv.2505.17019,
title = {Let Androids Dream of Electric Sheep: A Human-Inspired Image Implication Understanding and Reasoning Framework},
author = {Chenhao Zhang and Yazhe Niu},
journal= {arXiv preprint arXiv:2505.17019},
year = {2025}
}
备注
19 pages, 9 figures, 7 tables. Code & Dataset: https://github.com/MING-ZCH/Let-Androids-Dream-of-Electric-Sheep