PclGPT:用于检测居高临下与傲慢语言的大型语言模型
计算与语言
2024-10-02 v1
摘要
免责声明:本文中的样本可能有害并引起不适!居高临下与傲慢语言(PCL)是一种针对弱势群体的言语形式。作为有毒语言的一个重要分支,此类语言加剧了互联网社区之间的冲突与对抗,并对弱势群体产生不利影响。传统的预训练语言模型(PLM)由于PCL具有虚伪、虚假同情等隐含有毒特征,在检测PCL时表现不佳。随着大型语言模型(LLM)的兴起,我们可以利用其丰富的情感语义来建立一种探索隐含有毒性的范式。在本文中,我们介绍了PclGPT,一个专门为PCL设计的综合性LLM基准。我们收集、标注并整合了Pcl-PT/SFT数据集,然后通过全面的预训练和有监督微调阶梯式流程,开发了一个双语PclGPT-EN/CN模型组,以促进隐含有毒检测。来自PclGPT和其他模型的群体检测结果和细粒度检测显示,PCL对不同弱势群体的偏见程度存在显著差异,这需要社会给予更多关注以保护他们。
关键词
引用
@article{arxiv.2410.00361,
title = {PclGPT: A Large Language Model for Patronizing and Condescending Language Detection},
author = {Hongbo Wang and Mingda Li and Junyu Lu and Hebin Xia and Liang Yang and Bo Xu and Ruizhu Liu and Hongfei Lin},
journal= {arXiv preprint arXiv:2410.00361},
year = {2024}
}
备注
Accepted for EMNLP2024 (Findings)