BaitBuster-Bangla:用于孟加拉语点击诱饵检测的多特征多模态综合数据集
机器学习
2023-10-19 v1 人工智能
计算与语言
摘要
本研究提出一个大型多模态孟加拉语YouTube点击诱饵数据集,包含通过YouTube API和Python网络自动化框架以自动化流程收集的253,070个数据点。该数据集包含来自58个孟加拉语YouTube频道的单个视频的18种多样特征,分为元数据、主要内容、互动统计与标签。已应用严格的预处理步骤对特征去噪、去重并消除偏差,以确保无偏且可靠的分析。作为迄今为止最大且最稳健的孟加拉语点击诱饵语料库,该数据集为寻求推进低资源语言中点击诱饵现象建模的自然语言处理与数据科学研究人员提供了重要价值。其多模态特性允许跨内容、用户交互和语言维度对点击诱饵进行全面分析,以开发具有跨语言应用的更精细检测方法。
引用
@article{arxiv.2310.11465,
title = {BaitBuster-Bangla: A Comprehensive Dataset for Clickbait Detection in Bangla with Multi-Feature and Multi-Modal Analysis},
author = {Abdullah Al Imran and Md Sakib Hossain Shovon and M. F. Mridha},
journal= {arXiv preprint arXiv:2310.11465},
year = {2023}
}