基于视频字幕的 YouTube 错误信息检测
机器学习
2021-07-05 v1 计算与语言
摘要
数以百万计的人使用 YouTube、Facebook、Twitter 等平台及其他大众媒体。由于这些平台的可及性,它们常被用来建立叙事、开展宣传并传播错误信息。本工作提出一种利用最先进 NLP 技术从视频字幕(字幕文本)中提取特征的方法。为评估我们的方法,我们使用一个公开可访问且已标注的数据集,将视频分类为错误信息或非错误信息。探索视频字幕的动机源于我们对视频元数据的分析。诸如观看数、点赞数、点踩数和评论数等属性是无效的,因为难以利用这些信息区分视频。使用字幕数据集,所提出的模型能以 0.85 至 0.90 的 F1 分数在三类(错误信息、辟谣、中立)间分类视频。为强调错误信息类的相关性,我们将分类问题重新表述为二分类——错误信息 vs. 其他(辟谣与中立)。在我们的实验中,所提模型能以 0.92 至 0.95 的 F1 分数和 0.78 至 0.90 的 AUC ROC 对视频分类。
引用
@article{arxiv.2107.00941,
title = {Misinformation Detection on YouTube Using Video Captions},
author = {Raj Jagtap and Abhinav Kumar and Rahul Goel and Shakshi Sharma and Rajesh Sharma and Clint P. George},
journal= {arXiv preprint arXiv:2107.00941},
year = {2021}
}