利用大型语言模型和主题建模进行有害内容分类
计算与语言
2024-11-28 v1 机器学习
摘要
内容审查和有害内容分类代表了具有重要社会影响力的关键任务。然而,研究表明,主要分类模型存在放大或减小偏见倾向,可能忽视或不利于其分类过程中某些边缘群体。研究人员建议,注释员的立场会影响其中,模型所学习的从而传递注释员的偏见。为进一步调查注释员立场的影响,我们深入研究在数据集上对 BERTweet 和 HateBERT 进行微调,同时使用主题建模策略进行内容审查。结果表明,针对特定主题对模型进行微调会显著提高模型的 F1 分数,这与其他主要分类模型如 GPT-4、PerspectiveAPI 和 RewireAPI 的预测结果相比。这些发现进一步揭示了,与更早的方法相比,最先进的大型语言模型在准确检测和解释文本有害性方面存在显著局限性。代码可在 https://github.com/aheldis/Toxicity-Classification.git 获取。
引用
@article{arxiv.2411.17876,
title = {Leveraging Large Language Models and Topic Modeling for Toxicity Classification},
author = {Haniyeh Ehsani Oskouie and Christina Chance and Claire Huang and Margaret Capetz and Elizabeth Eyeson and Majid Sarrafzadeh},
journal= {arXiv preprint arXiv:2411.17876},
year = {2024}
}