超越元数据:面向YouTube诈骗视频的多模态与策略感知检测
密码学与安全
2026-04-02 v2
摘要
YouTube是一个重要的信息和娱乐平台,但其广泛的可访问性也使其对上传欺骗性或恶意内容的不良行为者具有吸引力。先前的检测方法主要依赖文本或统计元数据,如标题、描述、观看次数或点赞,这些在许多情况下有效,但可以通过看似无害的文本、操纵的统计数据或其他混淆策略(例如Leetspeak)来规避,同时忽略视觉线索。在本研究中,我们系统地研究了用于检测YouTube诈骗的多模态方法。我们的数据集整合了已建立的诈骗类别,并以完整视频和基于策略的推理注释进行了扩充。实验表明,仅使用标题和描述的文本模型(微调BERT)取得了中等性能(76.61% F1分数),加入音频转录后略有提升(77.98% F1分数)。使用微调LLaVA-Video模型进行视觉分析表现更好(79.61% F1分数),而结合标题、描述和视频帧的多模态框架取得了最高性能(82.96% F1分数)。此外,多模态框架在对抗扰动下表现出更强的鲁棒性,准确率仅下降1-3%,而单模态模型则下降12-38%。除了准确率之外,多模态框架还提供了可解释的、基于策略的推理,增强了自动审核的透明度和实用价值。利用这种方法,我们分析了6,374个真实YouTube视频并检测到1,864个诈骗,提供了明确的推理,为未来研究提供了宝贵的资源。
引用
@article{arxiv.2509.23418,
title = {Beyond Metadata: Multimodal, Policy-Aware Detection of YouTube Scam Videos},
author = {Ummay Kulsum and Aafaq Sabir and Abhinaya S. B. and Anupam Das},
journal= {arXiv preprint arXiv:2509.23418},
year = {2026}
}
备注
Accepted at AAAI ICWSM 2026