语言模型 moderator 能否改善在线话语的健康度?
计算与语言
2024-05-07 v2 人工智能
摘要
在线社区的对话式审核对于维持建设性环境的文明至关重要,但其难以规模化且对审核者有害。将复杂的自然语言生成模块作为力量倍增器以辅助人类审核者是一个诱人的前景,但迄今为止缺乏充分的评估方法。在本文中,我们基于审核文献建立了对话式审核有效性的系统定义,并确立了进行真实且安全评估的设计准则。随后,我们提出一个综合评估框架,以在人类干预独立的情况下评估模型的审核能力。借助我们的框架,我们开展了首个已知的将语言模型作为对话式审核者的研究,发现适当提示、融入社会科学见解的模型能够对有毒行为提供具体且公平的反馈,但难以影响用户提升其尊重与合作水平。
引用
@article{arxiv.2311.10781,
title = {Can Language Model Moderators Improve the Health of Online Discourse?},
author = {Hyundong Cho and Shuai Liu and Taiwei Shi and Darpan Jain and Basem Rizk and Yuyang Huang and Zixun Lu and Nuan Wen and Jonathan Gratch and Emilio Ferrara and Jonathan May},
journal= {arXiv preprint arXiv:2311.10781},
year = {2024}
}
备注
9 pages, NAACL 2024 Main