通过离群点检测优化提升情感分析结果
机器学习
2023-11-29 v1 人工智能
计算与语言
摘要
在处理带有说话者情感等主观标签的文本数据时,标注者间的不准确或分歧并不少见。此类分歧会显著影响机器学习算法的性能。本研究探讨识别并处理带主观标签文本数据中离群点的潜力,旨在提升分类效果。我们利用单类分类方法 Deep SVDD 算法,在九个基于文本的情感与情绪分析数据集中检测离群点。通过使用小尺寸语言模型(含 6600 万参数的 DistilBERT base 模型)与非深度学习机器学习算法(决策树、KNN、逻辑回归与 LDA)作为分类器,我们的结果表明在大多数情况下移除离群点可带来效果提升。此外,由于此类数据集中的离群点未必不可学习,我们尝试使用可捕捉数据中极复杂模式的大语言模型——含 1.31 亿参数的 DeBERTa v3 large。我们持续观察到多个数据集上的性能提升。
引用
@article{arxiv.2311.16185,
title = {Enhancing Sentiment Analysis Results through Outlier Detection Optimization},
author = {Yuetian Chen and Mei Si},
journal= {arXiv preprint arXiv:2311.16185},
year = {2023}
}
备注
11 pages, 5 figures