中文

CHASM:揭示中国社交媒体上的隐蔽广告

机器学习 2026-04-23 v1 人工智能 计算与语言 计算机视觉与模式识别 计算机与社会

摘要

当前用于评估大型语言模型(LLM)在社交媒体监测中能力的基准完全忽略了严重威胁:隐蔽广告,这些广告会伪装成常规帖子来欺骗和误导消费者进行购买,导致重大的伦理和法律问题。本文提出了CHASM,一个首次提出的人工智能多模态大型语言模型(MLLM)检测社交媒体上隐蔽广告能力的数据集。CHASM是一个高质量、经过匿名化处理、由人工审核的4992个数据实例数据集,基于来自中国社交媒体平台Rednote的真实场景收集。该数据集是在严格的隐私保护和质量控制协议下收集和标注的。它包括许多 closely resemble 隐蔽广告的产品经验分享帖,使数据集尤其具有挑战性。结果显示,在零样本和情境学习设置下,当前没有任何MLLM对于检测隐蔽广告足够可靠。我们的进一步实验表明,在数据集上对开源MLLM进行微调可获得显著的性能提升。然而,诸如检测评论中细微线索和视觉与文本结构差异等重大挑战仍然存在。我们提供了深入的错误分析,概述了未来的研究方向。我们希望本研究能为研究社区和平台监控员开发更精确的防御机制呼吁。

关键词

引用

@article{arxiv.2604.20511,
  title  = {CHASM: Unveiling Covert Advertisements on Chinese Social Media},
  author = {Jingyi Zheng and Tianyi Hu and Yule Liu and Zhen Sun and Zongmin Zhang and Zifan Peng and Wenhan Dong and Xinlei He},
  journal= {arXiv preprint arXiv:2604.20511},
  year   = {2026}
}

备注

NeuIPS 2025 (Datasets and Benchmarks Track)