中文

超越字面意义的推理:多模态 figurative language 的跨风格推理

计算与语言 2026-01-27 v1 机器学习

摘要

视觉语言模型(VLM)在字面意义的多模态任务中(如视觉数学和科学问答)已显示出强大的推理能力。然而,讽刺、幽默和隐喻等隐喻语言仍是一个重大挑战,因为它通过表达意义与预期意义之间的细微不一致来传递意图和情感。在多模态环境中,伴随的图像可以放大或反转文本意义,要求模型能够跨模态推理并考虑主观性。我们提出了一个三步骤框架,用于开发高效的多模态推理模型,以便(i)解释多模态隐喻语言,(ii)提供透明的推理痕迹,(iii)跨多个隐喻风格进行泛化。在四种风格的实验中显示,(1) 纳入推理痕迹可显著提高多模态隐喻理解能力,(2) 在一种风格中学习的推理可迁移到其他风格,尤其是讽刺和幽默等相关风格之间,(3) 在多个风格上联合训练可获得一个在性能上超过大量开源和闭源模型的通用推理VLM。我们的发现表明,具有可验证推理能力的轻量级VLM在提供可检查推理痕迹的同时,实现了跨风格的鲁棒泛化。代码和实现均可在 https://github.com/scheshmi/CrossStyle-MMR 获取。

关键词

引用

@article{arxiv.2601.17197,
  title  = {Reasoning Beyond Literal: Cross-style Multimodal Reasoning for Figurative Language Understanding},
  author = {Seyyed Saeid Cheshmi and Hahnemann Ortiz and James Mooney and Dongyeop Kang},
  journal= {arXiv preprint arXiv:2601.17197},
  year   = {2026}
}