中文

回应前像人一样思考:人设引导LLMs应对仇恨的多维度评估

计算与语言 2025-06-05 v1 人工智能 计算机与社会 人机交互 机器学习

摘要

自动反叙事(CN)为缓解在线仇恨言论提供了一种有前景的策略,但对其情感基调、可及性和伦理风险的担忧仍然存在。我们提出了一个框架,用于在四个维度上评估大语言模型(LLM)生成的CN:人设框架、冗长性与可读性、情感基调和伦理鲁棒性。使用GPT-4o-Mini、Cohere的CommandR-7B和Meta的LLaMA 3.1-70B,我们在MT-Conan和HatEval数据集上评估了三种提示策略。我们的发现表明,LLM生成的CN往往冗长且面向大学水平识字能力的人群,限制了其可及性。虽然情感引导的提示产生了更具共情性和可读性的响应,但仍存在关于安全性和有效性的担忧。

关键词

引用

@article{arxiv.2506.04043,
  title  = {Think Like a Person Before Responding: A Multi-Faceted Evaluation of Persona-Guided LLMs for Countering Hate},
  author = {Mikel K. Ngueajio and Flor Miriam Plaza-del-Arco and Yi-Ling Chung and Danda B. Rawat and Amanda Cercas Curry},
  journal= {arXiv preprint arXiv:2506.04043},
  year   = {2025}
}

备注

Accepted at ACL WOAH 2025