中文

基于大语言模型的对抗式风格增强:用于鲁棒虚假新闻检测

计算与语言 2024-10-17 v2

摘要

虚假新闻的传播损害个人行为,构成一个必须应对的最紧迫的社会挑战。尽管已developed许多算法和洞见特征用于检测虚假新闻,但许多这些特征可通过风格转换攻击进行操控,尤其是随着先进语言模型的出现,使其更难与真实新闻区分。本研究提出了一种对抗式风格增强方法AdStyle,用于训练具备鲁棒性的虚假新闻检测器,以抵抗各种风格转换攻击。主要机制涉及战略性地利用大语言模型自动生成多样且连贯的风格转换攻击提示,增强针对检测器最具挑战性的提示的生成。实验表明,our augmentation strategy在虚假新闻基准数据集上显著提高了鲁棒性和检测性能。

关键词

引用

@article{arxiv.2406.11258,
  title  = {SeRTS: Self-Rewarding Tree Search for Biomedical Retrieval-Augmented Generation},
  author = {Minda Hu and Licheng Zong and Hongru Wang and Jingyan Zhou and Jingjing Li and Yichen Gao and Kam-Fai Wong and Yu Li and Irwin King},
  journal= {arXiv preprint arXiv:2406.11258},
  year   = {2024}
}

备注

This work has been accepted by EMNLP 2024