中文

习语的视觉双关:基于迭代 LLM-T2IM-MLLM 框架

计算与语言 2025-12-01 v1 计算机视觉与模式识别

摘要

我们研究基于习语的视觉双关——即图像同时吻合习语的字面与隐喻意义的图像——并提出一种迭代框架,协调大语言模型(LLM)、文本到图像模型(T2IM)和多模态大语言模型(MLLM)进行自动生成与评估。给定习语,系统会迭代地(i)生成详细的视觉提示词,(ii)合成图像,(iii)从图像推断习语,(iv)优化提示词,直至识别成功或达到步骤限制。我们使用 1000 个习语作为输入,合成相应的视觉双关图像数据集并配以提示词,从而为生成与理解提供基准测试。跨 10 个 LLM、10 个 MLLM 以及一个 T2IM(Qwen-Image)的实验显示,MLLM 的选择是主要的性能驱动因素:GPT 实现最高的准确率,Gemini 紧随其后,最佳开源 MLLM(Gemma)在某些封闭模型中也能保持竞争力。在 LLM 方面,Claude 在提示词生成方面取得最强的平均性能。

关键词

引用

@article{arxiv.2511.22943,
  title  = {Visual Puns from Idioms: An Iterative LLM-T2IM-MLLM Framework},
  author = {Kelaiti Xiao and Liang Yang and Dongyu Zhang and Paerhati Tulajiang and Hongfei Lin},
  journal= {arXiv preprint arXiv:2511.22943},
  year   = {2025}
}

备注

Submitted to ICASSP 2026 (under review)