中文

从理论到实践:在社交媒体健康话语中评估数据投毒攻击与防御方法

机器学习 2025-10-07 v1 计算与语言 密码学与安全

摘要

本研究探讨了在公共卫生情感分析场景下,大型语言模型中的基于上下文学习(ICL)如何受到数据投毒攻击的破坏。使用人类肺炎病毒(HMPV)的推文数据,引入如同义词替换、否定插入和随机扰动等小型对抗扰动。即使是这些微小的操纵,也导致了严重的干扰,情感标签在最高可达67%的情况下被翻转。为解决此问题,应用了谱签名防御(Spectral Signature Defense),该方法在保持数据意义和情感完整性的同时过滤受投毒的示例。防御后,ICL准确率保持在约46.7%, logistic回归验证达到100%准确率,表明该防御成功地维护了数据集的完整性。总体而言,本研究将先前关于ICL投毒的理论研究扩展到了公共卫生话语分析的实际、高风险场景,凸显了面向可靠LLM部署的风险与潜在防御。本研究还强调了ICL在受攻击下的脆弱性,以及谱系防御在提升AI系统可靠性用于健康相关社交媒体监测方面的值。

关键词

引用

@article{arxiv.2510.03636,
  title  = {From Theory to Practice: Evaluating Data Poisoning Attacks and Defenses in In-Context Learning on Social Media Health Discourse},
  author = {Rabeya Amin Jhuma and Mostafa Mohaimen Akand Faisal},
  journal= {arXiv preprint arXiv:2510.03636},
  year   = {2025}
}