论辩卫士:在多语言脱稿语言检测中评估大语言模型
计算与语言
2024-10-22 v1
摘要
识别脱稿语言是维持社交媒体时代安全与可持续性的关键。尽管大语言模型(LLM)在社交媒体分析中展现出鼓舞潜力,但在脱稿语言检测领域缺乏深入评估,尤其是在多语言环境下。我们首次评估 LLMs 在英语、西班牙语和德语三种语言上的多语言脱稿语言检测性能,所选模型包括 GPT-3.5、Flan-T5 和 Mistral,分别在单语和多语境环境中进行测试。我们进一步探讨了不同提示语言和增强翻译数据对非英语语境下任务影响。此外,我们讨论了 LLMs 本身及数据集中固有的偏见如何导致对敏感话题的错误预测。
引用
@article{arxiv.2410.15623,
title = {Guardians of Discourse: Evaluating LLMs on Multilingual Offensive Language Detection},
author = {Jianfei He and Lilin Wang and Jiaying Wang and Zhenyu Liu and Hongbin Na and Zimu Wang and Wei Wang and Qi Chen},
journal= {arXiv preprint arXiv:2410.15623},
year = {2024}
}
备注
Accepted at UIC 2024 proceedings. Accepted version