中文

对比聚类:面向情感与情绪分类的无监督偏差消减

计算与语言 2021-11-16 v1 人工智能

摘要

背景:当神经网络情感与情绪分类器用于公共卫生信息学研究中时,分类器中存在的偏差可能产生无意间的误导性结果。目标:本研究评估了偏差对 COVID-19 相关话题的影响,并展示了一种在应用于 COVID-19 社交媒体文本时用于减小偏差的自动算法。这有助于公共卫生信息学研究中在危机期间产生更及时的结果,并降低误导性结果的风险。方法:在使用无监督对比聚类对分类器去偏前后,将情感与情绪分类器应用于 COVID-19 数据。对比聚类通过对比词元相对于话题而非情感或情绪的相对显著性,来近似词元与情感或情绪之间表现出的因果 versus 相关关系的程度。结果:对比聚类以 0.753 的 F1 分数区分词元的相关系与因果系。从分类器输入中掩蔽易偏词元使分类器整体 F1 分数降低 0.02(愤怒)和 0.033(负向情绪),但将被标注为易偏的句子 F1 分数提高 0.155(愤怒)和 0.103(负向情绪)。跨话题平均,去偏使愤怒估计降低 14.4%,负向情绪估计降低 8.0%。结论:对比聚类减少了针对 COVID-19 大流行相关社交媒体文本的情感与情绪分类中的算法偏差。公共卫生信息学研究中应考虑偏差,因其在一系列话题中普遍存在。需进一步研究以改进偏差消减技术,并探索偏差对公共卫生信息学分析的不利影响。

关键词

引用

@article{arxiv.2111.07448,
  title  = {Contrastive Clustering: Toward Unsupervised Bias Reduction for Emotion and Sentiment Classification},
  author = {Jared Mowery},
  journal= {arXiv preprint arXiv:2111.07448},
  year   = {2021}
}

备注

19 pages, 3 figures, 5 tables