中文

CounterMoral:语言模型中的道德编辑

人工智能 2026-03-31 v1

摘要

近期语言模型技术的进步显著增强了编辑事实信息的能力。然而,道德判断的修改——即将模型与人类价值观对齐的关键方面——受到的关注较少。在本工作中,我们引入CounterMoral,一个精心设计的基准数据集,用于评估当前模型编辑技术在多种伦理框架下修改道德判断的程度。我们对多种语言模型应用了各种编辑技术并评估其性能。我们的发现有助于评估旨在具备伦理性的语言模型。

关键词

引用

@article{arxiv.2603.27338,
  title  = {CounterMoral: Editing Morals in Language Models},
  author = {Michael Ripa and Jim Davies},
  journal= {arXiv preprint arXiv:2603.27338},
  year   = {2026}
}

备注

7 pages (10 + 1 reference + 6 appendix). Honors thesis completed in June 2024, write-up completed in 2025