中文

DIVERSE:基于数据编程模型的 YouTube 视频评论立场数据集

计算与语言 2024-10-30 v3 人工智能

摘要

公众对军事组织的看法显著影响其招募人才的能力。随着招募工作日益扩展到社交媒体等数字空间,评估社交媒体用户对在线军事内容的立场变得至关重要。然而,目前缺乏用于分析在线军事招募工作舆论的数据,且立场标注面临挑战,而这对理解公众认知至关重要。尽管立场分析对于成功的在线军事招募非常重要,但创建人工标注的领域内立场标签资源消耗巨大。在本文中,我们通过引入并发布 DIVERSE 数据集(https://doi.org/10.5281/zenodo.10493803)来解决立场标注的挑战以及在线军事招募公众舆论数据稀缺的问题。该数据集包含美国陆军官方 YouTube 频道视频的所有评论。我们采用了一种最先进的弱监督方法,利用大语言模型(LLM)对每条评论针对其对应视频及美国陆军的立场进行标注。我们的研究结果表明,美国陆军的视频在 2021 年后开始吸引大量评论,立场分布通常在支持、反对和中立评论之间保持平衡,但略微偏向反对而非支持。

关键词

引用

@article{arxiv.2403.03334,
  title  = {DIVERSE: A Dataset of YouTube Video Comment Stances with a Data Programming Model},
  author = {Iain J. Cruickshank and Amir Soofi and Lynnette Hui Xian Ng},
  journal= {arXiv preprint arXiv:2403.03334},
  year   = {2024}
}

备注

Accepted at IEEE Big Data 2024