基于 PPO 的对比学习驱动的讽刺生成框架——ViSP
计算与语言
2025-07-15 v1 人工智能
人机交互
摘要
人类情感复杂,讽刺作为一种微妙而独特的形式。尽管讽刺研究取得了进展,但讽刺生成仍未得到充分探索,主要由于过度依赖文本模式且忽视了视觉线索,以及现有数据集中图像内容与讽刺意图之间的不匹配。在本文中,我们引入了 M2SaG,一个包含 4,970 个样本的多模态讽刺生成数据集,每个样本包含一张图像、一段讽刺文本以及讽刺目标。为评估 M2SaG,我们提出了 ViSP,一个集成近端策略优化(PPO)和对比学习的生成框架。PPO 利用 DIP 提供的奖励分数来引导讽刺文本的生成,而对比学习则鼓励模型倾向于获得更高的奖励分数的输出。这些策略提高了整体生成质量,产生更具讽刺意义的文本。我们在五个指标集合上对 ViSP 进行了评估,发现其优于所有基线,包括大型语言模型,凸显了大型语言模型在讽刺生成方面的局限性。此外,我们分析了 M2SaG 和 ViSP 生成的文本在讽刺分数和事实不一致性方面的分布。生成的文本在平均讽刺分数(0.898 vs. 0.770)和事实不一致性(0.768 vs. 0.739)上均高于原始数据集,表明 ViSP 产生的讽刺内容质量更高。% 数据集和代码将公开。我们的数据集和代码将在\textit{https://github.com/wclapply/ViSP} 上发布。
引用
@article{arxiv.2507.09482,
title = {ViSP: A PPO-Driven Framework for Sarcasm Generation with Contrastive Learning},
author = {Changli Wang and Rui Wu and Fang Yin},
journal= {arXiv preprint arXiv:2507.09482},
year = {2025}
}