中文

基于Transformer模型转录文本上下文分析的YouTube misinformation识别

计算与语言 2023-07-25 v1

摘要

YouTube 上的 misinformation(虚假信息)是一个重要问题,亟需稳健的检测策略。本文提出一种用于视频分类的新方法,重点关注内容的真实性。我们利用从视频转录文本中提取的文本信息,将传统的视频分类任务转化为文本分类任务。我们采用迁移学习等先进机器学习技术来解决该分类难题。我们的方法包含两种迁移学习形式:(a) 微调 BERT、RoBERTa 和 ELECTRA 等基础 transformer 模型,(b) 使用 sentence-transformers MPNet 和 RoBERTa-large 进行少样本学习。我们将训练好的模型应用于三个数据集:(a) YouTube 疫苗相关 misinformation 视频,(b) YouTube 伪科学视频,(c) Fake-News 数据集(文章合集)。纳入 Fake-News 数据集将我们方法的评估扩展到了 YouTube 视频之外。使用这些数据集,我们评估了模型区分有效信息与 misinformation 的能力。在两个数据集中,微调模型的 Matthews 相关系数>0.81、准确率>0.90、F1 分数>0.90。有趣的是,在 YouTube 伪科学数据集上,少样本模型在准确率和 F1 分数上均比微调模型高出 20%,凸显了该方法——尤其在训练数据有限情境下——的潜在效用。

关键词

引用

@article{arxiv.2307.12155,
  title  = {Identifying Misinformation on YouTube through Transcript Contextual Analysis with Transformer Models},
  author = {Christos Christodoulou and Nikos Salamanos and Pantelitsa Leonidou and Michail Papadakis and Michael Sirivianos},
  journal= {arXiv preprint arXiv:2307.12155},
  year   = {2023}
}