ThumbnailTruth:一种跨不同文化背景检测误导性YouTube缩略图的多模态LLM方法
社会与信息网络
2025-09-08 v1
摘要
YouTube等平台上的误导性视频缩略图是一个普遍存在的问题,破坏了用户信任和平台完整性。本文提出了一种新颖的多模态检测流水线,该流水线使用大型语言模型(LLM)来标记误导性缩略图。我们首先构建了一个包含来自八个国家2,843个视频的综合数据集,其中包括1,359个误导性缩略图视频,这些视频累计观看次数超过76亿次——为这一全球问题提供了独特的跨文化视角。我们的检测流水线集成了视频到文本描述、缩略图图像和字幕转录,以全面分析内容并标记误导性缩略图。通过广泛的实验和提示工程,我们评估了最先进的LLM的性能,包括GPT-4o、GPT-4o Mini、Claude 3.5 Sonnet和Gemini-1.5 Flash。我们的发现表明了LLM在识别误导性缩略图方面的有效性,其中Claude 3.5 Sonnet始终表现出强劲的性能,在特定场景下实现了93.8%的准确率、超过92%的精确率和超过94%的召回率。我们讨论了我们的发现对内容审核、用户体验以及大规模部署此类系统的伦理考虑的影响。我们的发现为更透明、更可信的视频平台和为全球观众提供更强的内容完整性铺平了道路。
引用
@article{arxiv.2509.04714,
title = {ThumbnailTruth: A Multi-Modal LLM Approach for Detecting Misleading YouTube Thumbnails Across Diverse Cultural Settings},
author = {Wajiha Naveed and Zartash Afzal Uzmi and Zafar Ayyub Qazi},
journal= {arXiv preprint arXiv:2509.04714},
year = {2025}
}