通过音频分析识别僧伽罗语 YouTube 视频中的虚假内容与仇恨言论
音频与语音处理
2024-02-06 v1 人工智能
计算与语言
机器学习
声音
摘要
YouTube 正面临虚假信息和仇恨言论传播的全球性危机。为了应对这些问题,YouTube 已经实施了严格的规定,禁止上传包含虚假信息或宣扬仇恨言论的内容。虽然已有大量研究致力于减少英语攻击性内容,但针对僧伽罗语内容的研究却显著匮乏。本研究旨在通过提出一种解决方案来最大限度地减少僧伽罗语 YouTube 视频中暴力和错误信息的传播,从而填补上述空白。该方法涉及开发一个评级系统,通过将标题和描述与音频内容进行比较来评估视频是否包含虚假信息,并评估视频是否包含仇恨言论。该方法论包含几个步骤,包括使用 Pytube 库提取音频,通过微调的 Whisper 模型进行音频转录,采用 distilroberta-base 模型和文本分类 LSTM 模型进行仇恨言论检测,以及通过微调的 BART-Large-XSUM 模型进行文本摘要。值得注意的是,Whisper 模型实现了 48.99% 的词错误率,而 distilroberta-base 模型则表现出 0.856 的 F1 分数和 0.861 的召回率,相比之下,LSTM 模型则表现出了过拟合的迹象。
引用
@article{arxiv.2402.01752,
title = {Identifying False Content and Hate Speech in Sinhala YouTube Videos by Analyzing the Audio},
author = {W. A. K. M. Wickramaarachchi and Sameeri Sathsara Subasinghe and K. K. Rashani Tharushika Wijerathna and A. Sahashra Udani Athukorala and Lakmini Abeywardhana and A. Karunasena},
journal= {arXiv preprint arXiv:2402.01752},
year = {2024}
}