EMNLP:教育者角色道德与规范大语言模型轮廓
计算与语言
2025-12-19 v3 人工智能
摘要
模拟职业(Simulating Professions, SP)使大语言模型(LLMs)能够模拟专业角色。然而,这类情境下的全面心理与伦理评估仍缺乏。本文引入EMNLP,即教育者角色道德与规范LLM轮廓框架,用于人格轮廓、道德发展阶段测量以及软提示注入下的伦理风险评估。EMNLP扩展现有尺度与构建,包含88个教师专用道德困境,实现职业导向的人类教师比较。针对教师角色LLM,我们构建了针对性软提示注入集合,以评估合规性与脆弱性。14种LLM的实验表明,教师角色LLM的 personality profile 显示其展现出比人类教师更理想化和极化的性格,擅长抽象道德推理,但在情感复杂情境中表现不足。具有更强推理能力的模型对有害提示注入更脆弱,这揭示了能力与安全性之间的悖论。模型温度及其他超参数对大多数情况影响有限,仅在某些风险行为中有显著影响。本文首次构建评估教师角色LLM伦理与心理对齐程度的基准,资源可在https://e-m-n-l-p.github.io/获取。
引用
@article{arxiv.2508.15250,
title = {EMNLP: Educator-role Moral and Normative Large Language Models Profiling},
author = {Yilin Jiang and Mingzi Zhang and Sheng Jin and Zengyi Yu and Xiangjie Kong and Binghao Tu},
journal= {arXiv preprint arXiv:2508.15250},
year = {2025}
}
备注
29pages, 15 figures, Accepted by EMNLP Main Confrence