X-Troll:国家赞助信息操作代理的可解释检测
计算与语言
2025-11-13 v2
摘要
国家赞助的讽刺者是部署复杂语言操纵的恶意行为者,威胁在线话语完整性。虽然大型语言模型 (LLM) 在通用自然语言处理任务中取得了优异性能,但它们在细微的宣传检测方面仍感到困难,且作为“黑盒子”,无法提供对操纵策略的可解释见解。本文引入 X-Troll,一个新型框架,通过整合可解释适配器式 LLM 与专家推导的语言知识,检测国家赞助的讽刺者并提供其决策的人类可读解释。X-Troll 整合了情感理论和宣传分析,通过专用 LoRA 适配器实现,采用动态门控捕获协调信息操作中的 campaign-specific 话语模式。针对真实数据的实验表明,我们的语言知识驱动方法在准确率方面优于通用 LLM 基线和现有讽刺检测模型,同时通过基于专家 grounding 的解释提供了增强的透明度,揭示国家赞助行为者所使用的特定语言策略。X-Troll 源代码可在 https://github.com/ltian678/xtroll_source/ 获取。
引用
@article{arxiv.2508.16021,
title = {X-Troll: eXplainable Detection of State-Sponsored Information Operations Agents},
author = {Lin Tian and Xiuzhen Zhang and Maria Myung-Hee Kim and Jennifer Biggs and Marian-Andrei Rizoiu},
journal= {arXiv preprint arXiv:2508.16021},
year = {2025}
}
备注
15 pages, 5 figures, 4 tables, accepted by CIKM2025