中文

基于 BERT 与可解释 AI 的孟加拉语讽刺检测

计算与语言 2023-03-23 v1 人工智能

摘要

带有潜在负面动机的积极短语或句子通常被定义为讽刺,其广泛用于当今 Facebook、Twitter、Reddit 等社交媒体平台。近年来社交媒体平台的活跃用户急剧增加,这提升了对基于 NLP 的自动化系统的需求,该系统可用于市场需求判定、情感分析、威胁检测等多种任务。然而,由于讽刺通常表达相反含义且其检测常具挑战性,通过基于 NLP 的模型提取数据含义变得更加复杂。因此,过去几年中关于英语讽刺检测的研究很多且已有显著进展,但孟加拉语讽刺检测的现状仍无改观。本文提出一种基于 BERT 的系统,其准确率达 99.60%,而所用的传统机器学习算法仅能达到 89.93%。此外,我们采用了局部可解释模型无关解释(Local Interpretable Model-Agnostic Explanations)为系统引入可解释性。我们还使用了一个新收集的孟加拉语讽刺数据集 BanglaSarc,该数据集专为本次研究评估而构建,包含讽刺与非讽刺评论的新近记录,大部分取自 Facebook 和 YouTube 评论区。

关键词

引用

@article{arxiv.2303.12772,
  title  = {Interpretable Bangla Sarcasm Detection using BERT and Explainable AI},
  author = {Ramisa Anan and Tasnim Sakib Apon and Zeba Tahsin Hossain and Elizabeth Antora Modhu and Sudipta Mondal and MD. Golam Rabiul Alam},
  journal= {arXiv preprint arXiv:2303.12772},
  year   = {2023}
}