基于 GAN 与 LLM 的中文讽刺检测数据增强框架:动态建模语言模式
计算与语言
2026-04-10 v1 人工智能
摘要
讽刺是一种修辞手法,通过夸张、讽刺或比较等方式表达对特定个体或情境的批评或强调其特征。现有中文讽刺检测方法受限于数据集有限和高建设成本,主要关注文本特征,忽视了塑造意见和情感表达方式的用户特定语言模式。本文提出一种基于生成对抗网络(GAN)和大型语言模型(LLM)的数据增强框架,用于动态建模用户语言模式以提升中文讽刺检测效果。首先,我们从新浪微博的多个话题收集原始数据。随后,在这些数据上训练 GAN,并应用基于 GPT-3.5 的数据增强技术合成扩展的讽刺评论数据集,命名为 SinaSarc。该数据集包含目标评论、上下文信息及用户历史行为。最后,我们扩展 BERT 架构,融合多维度信息,特别是用户历史行为,使模型能够捕捉动态语言模式并揭示评论中隐含的讽刺线索。实验结果表明,我们提出的方法有效。具体而言,本模型在非讽刺和讽刺类别上的 F1 分别达到最高值 0.9138 和 0.9151,均超越了所有现有最先进(SOTA)方法。该研究为动态建模中文讽刺检测中的用户长期语言模式,贡献了数据集构建与方法学上的新颖框架。
引用
@article{arxiv.2604.08381,
title = {A GAN and LLM-Driven Data Augmentation Framework for Dynamic Linguistic Pattern Modeling in Chinese Sarcasm Detection},
author = {Wenxian Wang and Xiaohu Luo and Junfeng Hao and Xiaoming Gu and Xingshu Chen and Zhu Wang and Haizhou Wang},
journal= {arXiv preprint arXiv:2604.08381},
year = {2026}
}