大语言模型能否区分有害与议论文?迈向合乎道德的作文评分
计算与语言
2026-01-12 v1
摘要
本研究探讨了自动作文评分(AES)系统和大语言模型(LLMs)在有效识别和评分有害作文能力方面的关键差距。尽管AES技术取得了进步,但当前模型常常忽略作文中伦理和道德上有问题的元素,错误地为可能传播有害观点的作文打高分。在本研究中,我们引入了有害作文检测(HED)基准,该基准包含涉及种族主义和性别偏见等敏感主题的作文,以测试各种LLM在识别和评分有害内容方面的效能。我们的发现揭示:(1) LLM需要进一步增强才能准确区分有害作文和论证性作文,(2) 当前的AES模型和LLM在评分时均未能考虑内容的伦理维度。该研究强调了开发更健壮的AES系统的必要性,这些系统应对其所评分内容的伦理影响保持敏感。
引用
@article{arxiv.2601.05545,
title = {Can Large Language Models Differentiate Harmful from Argumentative Essays? Steps Toward Ethical Essay Scoring},
author = {Hongjin Kim and Jeonghyun Kang and Harksoo Kim},
journal= {arXiv preprint arXiv:2601.05545},
year = {2026}
}
备注
COLING 2025 accepted paper (Main)