中文

BigTokDetect:面向TikTok大型乳酸症视频的临床导向视觉-语言建模框架

计算机视觉与模式识别 2026-01-27 v3

摘要

社交媒体平台面临着检测有助于肌肉紧张障碍行为和认知(bigorexia)的有害内容的日益增加的挑战。此类内容可通过伪装成合法健身建议来规避审核, disproportionately影响青少年男性。我们通过BigTokDetect解决了这一挑战,这是一个用于识别TikTok上 pro-bigorexia 内容的临床导向框架。我们引入BigTok,首个由临床精神科医生在五个主要类别和十八个细分类别中标注的超过2200个TikTok视频的多模态基准数据集。对最先进的视觉-语言模型进行全面评估发现,尽管商业零样本模型在广泛的主要类别中实现最高准确率,但监督式微调使较小的开源模型在细分类别检测中表现更好。消融研究表明,多模态融合可提升5-15个百分点,其中视频特征提供了最具辨识力的信号。这些发现支持一种以自动化检测明确伤害、同时对模糊内容进行人工审核的扎实审核方法,建立了一个可扩展的框架,用于在新兴心理健康领域进行伤害缓解。

关键词

引用

@article{arxiv.2508.06515,
  title  = {BigTokDetect: A Clinically-Informed Vision-Language Modeling Framework for Detecting Pro-Bigorexia Videos on TikTok},
  author = {Minh Duc Chu and Kshitij Pawar and Zihao He and Roxanna Sharifi and Ross Sonnenblick and Magdalayna Curry and Laura D'Adamo and Lindsay Young and Stuart B Murray and Kristina Lerman},
  journal= {arXiv preprint arXiv:2508.06515},
  year   = {2026}
}