中文

探究大语言模型中伦理框架的表征:结构、纠缠与方法论挑战

计算与语言 2026-03-26 v1 人工智能

摘要

当大语言模型作出伦理判断时,它们的内部表征是否区分规范框架,还是将伦理压缩为单一的可接受性维度?我们在六个跨越 4B--72B 参数规模的大语言模型中,探讨了五种伦理框架(deontology、utilitarianism、virtue、justice、commonsense)的隐藏表征。我们的分析揭示了具有非对称迁移模式的不同伦理子空间——例如,deontology probes 在 virtue 场景中部分泛化,而 commonsense probes 在 justice 场景中则 catastrophic 失败。deontological 与 utilitarian probes 之间的不一致与模型在不同架构下的行为熵呈正相关,尽管这一关系可能部分反映出对情景难度的共同敏感性。后验验证表明,探针部分依赖于基准模板的表面特征,这促使我们对解释持谨慎态度。我们讨论了这些方法提供的结构性洞见以及其认识论的局限性。

关键词

引用

@article{arxiv.2603.23659,
  title  = {Probing Ethical Framework Representations in Large Language Models: Structure, Entanglement, and Methodological Challenges},
  author = {Weilun Xu and Alexander Rusnak and Frederic Kaplan},
  journal= {arXiv preprint arXiv:2603.23659},
  year   = {2026}
}