学习像漫画作家一样思考:基于不一致-解决监督的多模态幽默理解
人工智能
2026-04-17 v1 计算与语言
摘要
幽默是少数几个关键任务之一,在此任务中,正确的推理过程与正确的答案同等重要。虽然最近的工作在诸如《纽约客漫画标题竞赛》(NYCC) 等基准上评估幽默理解,但大多数情况下将其视为黑盒预测,忽略了幽默理解背后结构化的推理过程。我们引入 IRS(Incongruity-Resolution Supervision),一个将幽默理解分解为三个组成部分的框架:不一致建模,识别视觉场景中的不匹配;解决建模,构建这些不匹配的连贯重新解释;偏好对齐,评估候选解释下的人类判断。在不一致-解决理论和专家标题作家实践基础上,IRS 通过结构化痕迹监督中间推理过程,使从视觉感知到幽默解释的路径变得显式且可学习。在 NYCC 上进行 7B、32B 和 72B 的模型实验中,IRS 在标题匹配和排序任务上超越了强大的开放式和封闭式多模态基线,其中最大模型接近专家水平的排序性能。零样本迁移到外部基准显示,IRS 学习到了可通用的推理模式。我们的结果表明,监督推理结构而非规模本身,是解答以推理为中心任务的关键。
引用
@article{arxiv.2604.15210,
title = {Learning to Think Like a Cartoon Captionist: Incongruity-Resolution Supervision for Multimodal Humor Understanding},
author = {Hatice Merve Vural and Doga Kukul and Ege Erdem Ozlu and Demir Ekin Arikan and Bob Mankoff and Erkut Erdem and Aykut Erdem},
journal= {arXiv preprint arXiv:2604.15210},
year = {2026}
}