PolyHope:基于推文的两层级希望言论检测
计算与语言
2022-11-07 v2 人工智能
计算机与社会
机器学习
摘要
希望被刻画为面向未来的开放心态,一种对某事发生或成真的渴望、期待与祝愿,它显著影响着人类的心智状态、情绪、行为与决策。希望通常与有关未来的期望诉求及可能性/概率概念相关联。尽管其重要,希望却极少作为社交媒体分析任务被研究。本文提出一个希望言论数据集,将每条推文先分类为“希望”与“非希望”,再细分为三个细粒度希望类别:“泛化希望”“现实希望”与“非现实希望”(以及“非希望”)。我们收集了2022年上半年的英文推文以构建该数据集。此外,我们详细描述了标注流程与指南,并讨论了希望分类的挑战及现有希望言论检测语料的局限性。我们还基于不同学习方法(如传统机器学习、深度学习和transformers)报告了若干基线以对数据集进行基准测试。我们使用加权平均与宏平均F1分数评估基线。观察表明,严格的标注者筛选流程与详尽的标注指南提升了数据集质量。这一严格标注流程使得仅使用二元词组的简单机器学习分类器也取得了可观表现;然而,二分类与多分类希望言论检测结果显示,上下文嵌入模型在该数据集上具有更高性能。
引用
@article{arxiv.2210.14136,
title = {PolyHope: Two-Level Hope Speech Detection from Tweets},
author = {Fazlourrahman Balouchzahi and Grigori Sidorov and Alexander Gelbukh},
journal= {arXiv preprint arXiv:2210.14136},
year = {2022}
}
备注
20 pages, 9 figures