中文

LLM-C3MOD:面向跨文化仇恨言论审核的人机与 LLM 协作系统

计算与语言 2025-11-11 v1 人工智能

摘要

内容审核是一项全球性挑战,然而主要科技平台优先考虑高资源语言,导致低资源语言缺乏母语审核员。由于有效的审核依赖于对语境线索的理解,这种不平衡增加了非母语审核员因文化理解有限而导致审核不当的风险。通过一项用户研究,我们发现非母语审核员在仇恨言论审核中难以解释特定文化的知识、情感和网络文化。为了帮助他们,我们提出了 LLM-C3MOD,一个包含三个步骤的人机与 LLM 协作流程:(1) RAG 增强的文化语境标注;(2) 基于 LLM 的初始审核;(3) 针对缺乏 LLM 共识的案例进行定向人工审核。在一个韩语仇恨言论数据集上对印尼和德国参与者进行评估,我们的系统达到了 78% 的准确率(超过 GPT-4o 的 71% 基线),同时将人工工作量减少了 83.6%。值得注意的是,人工审核员在 LLM 难以处理的细微内容上表现出色。我们的研究结果表明,非母语审核员在 LLM 的适当支持下,可以有效地为跨文化仇恨言论审核做出贡献。

关键词

引用

@article{arxiv.2503.07237,
  title  = {LLM-C3MOD: A Human-LLM Collaborative System for Cross-Cultural Hate Speech Moderation},
  author = {Junyeong Park and Seogyeong Jeong and Seyoung Song and Yohan Lee and Alice Oh},
  journal= {arXiv preprint arXiv:2503.07237},
  year   = {2025}
}

备注

Accepted to NAACL 2025 Workshop - C3NLP (Workshop on Cross-Cultural Considerations in NLP)