中文

通过数据增强与蒸馏提升大语言模型的心理操纵检测能力

计算与语言 2026-01-30 v5

摘要

心理操纵在社交媒体上构成对个体心理健康和线上交互完整性的隐蔽且严重威胁。由于标注训练数据难以获取、其高度隐蔽且多轮的特性以及缺乏真实世界数据集,检测此类行为具有挑战性。为此,我们提出MentalMAD框架,通过数据增强和蒸馏来增强大语言模型的心理操纵检测能力。本方法包含三个关键组件:EvoSA,一种结合演化操作与话语行为感知式提示的无标注数据增强方法;教师模型生成的补充任务监督;以及Complementary-Convergent Distillation(补充-收敛蒸馏),一种将操纵特定知识传递给学生模型的阶段性策略。我们随后构建了ReaMent数据集,包含5000个来自真实世界的对话。大量实验表明,MentalMAD在最强基线上实现了准确率提升14.0%、宏平均F1提升27.3%和加权F1提升15.1%。该代码和数据集已公开于https://github.com/Yuansheng-Gao/MentalMAD。

关键词

引用

@article{arxiv.2505.15255,
  title  = {Boosting Large Language Models for Mental Manipulation Detection via Data Augmentation and Distillation},
  author = {Yuansheng Gao and Peng Gao and Han Bao and Bin Li and Jixiang Luo and Zonghui Wang and Wenzhi Chen},
  journal= {arXiv preprint arXiv:2505.15255},
  year   = {2026}
}

备注

Accepted to WWW 2026