探究大语言模型中伦理框架的表征:结构、纠缠与方法论挑战
计算与语言
2026-03-26 v1 人工智能
摘要
当大语言模型作出伦理判断时,它们的内部表征是否区分规范框架,还是将伦理压缩为单一的可接受性维度?我们在六个跨越 4B--72B 参数规模的大语言模型中,探讨了五种伦理框架(deontology、utilitarianism、virtue、justice、commonsense)的隐藏表征。我们的分析揭示了具有非对称迁移模式的不同伦理子空间——例如,deontology probes 在 virtue 场景中部分泛化,而 commonsense probes 在 justice 场景中则 catastrophic 失败。deontological 与 utilitarian probes 之间的不一致与模型在不同架构下的行为熵呈正相关,尽管这一关系可能部分反映出对情景难度的共同敏感性。后验验证表明,探针部分依赖于基准模板的表面特征,这促使我们对解释持谨慎态度。我们讨论了这些方法提供的结构性洞见以及其认识论的局限性。
引用
@article{arxiv.2603.23659,
title = {Probing Ethical Framework Representations in Large Language Models: Structure, Entanglement, and Methodological Challenges},
author = {Weilun Xu and Alexander Rusnak and Frederic Kaplan},
journal= {arXiv preprint arXiv:2603.23659},
year = {2026}
}