中文

文化感知的幽默字幕生成:跨文化语境下的多模态幽默生成

计算与语言 2026-04-21 v1 计算机视觉与模式识别

摘要

最近的多模态大语言模型在生成图像的幽默字幕方面显示出有前景的能力,但它们仍然缺乏对显式文化语境的稳定控制,使得在指定文化背景下难以同时保持图像相关性、语境适当性和幽默质量。为了解决这一局限性,我们引入了一个新的多模态生成任务——文化感知的幽默字幕生成,该任务要求模型根据输入图像和目标文化语境生成幽默字幕。在不同文化语境下生成的字幕不应共享相同的表面形式,但应保持基于相似的视觉情境或幽默原理。为支持此任务,我们建立了一个六维评估框架,涵盖图像相关性、语境契合度、语义丰富度、合理性、幽默性和创造力。我们进一步提出一个分阶段对齐框架,该框架首先在西式文化语境下使用高资源监督初始化模型,然后通过基于评判器的GRPO(组相对策略优化)结合退化感知原型排斥约束进行多维偏好对齐,以缓解开放生成中的奖励黑客问题,最后使用少量监督将模型适应到东方文化语境。实验结果表明,我们的方法在所提出的评估框架下实现了更强的整体性能,在语境契合度方面取得了特别大的提升,并在文化约束下更好地平衡了图像相关性和幽默性。

关键词

引用

@article{arxiv.2604.18091,
  title  = {Culture-Aware Humorous Captioning: Multimodal Humor Generation across Cultural Contexts},
  author = {Run Xu and Lu Li and Rongzhao Zhang and Jie Xu},
  journal= {arXiv preprint arXiv:2604.18091},
  year   = {2026}
}