中文

大语言模型时代的极端言语分类:探索开源与专有模型

计算与语言 2025-02-24 v1 人工智能

摘要

近年来,随着互联网普及和各类社交媒体平台用户数的增长,极端言语在线上扩散呈现显著上升趋势。虽然传统语言模型在区分中性文本与非中性文本(即极端言语)方面表现良好,但对极端言语的多样类型进行分类仍面临显著挑战。极端言语分类任务尤为细致,因为它需要深入理解社会文化语境,才能准确解读言语意图。甚至的人类标注者在对此类内容的合适分类上也常出现分歧,凸显了该任务的复杂与主观性。依赖人类审核员的做法也存在扩张瓶颈,亟需自动化系统来实现极端言语分类。近期ChatGPT的推出引发全球关注,突显大语言模型(LLM)在广泛任务中的潜在应用。基于庞大且多样化语料训练,能够有效捕获和编码语境信息的LLM,成为解决此特定任务的高度有前景的工具。本文我们利用Maronikolakis等人(2022)提供的极端言语数据集中的印度子集,开发有效的分类框架。我们评估了开源的Llama模型与闭源的OpenAI模型,发现预训练LLM显示中等效能,但通过领域特定数据微调可显著提升性能,凸显其对语言和语境细微差异的适应性。尽管GPT类模型在零样本设置下优于Llama模型,但在微调后,两者的性能差距逐渐消失。

关键词

引用

@article{arxiv.2502.15155,
  title  = {Extreme Speech Classification in the Era of LLMs: Exploring Open-Source and Proprietary Models},
  author = {Sarthak Mahajan and Nimmi Rangaswamy},
  journal= {arXiv preprint arXiv:2502.15155},
  year   = {2025}
}

备注

Accepted to 7th International Conference on information systems and management science (ISMS), 2024