中文

重新思考机器伦理——LLM能否借助道德理论视角进行道德推理?

计算与语言 2024-07-02 v2

摘要

做出道德判断是开发伦理AI系统的关键一步。主流方法多以自下而上的方式实现,即利用大量标注数据基于众包的道德意见训练模型。这些方法被批评为过度泛化了有限标注者的道德立场且缺乏可解释性。本工作提出一个灵活的自上而下框架,引导(大)语言模型(LMs)借助跨学科研究中成熟的道德理论进行道德推理。该理论引导的自上而下框架可纳入多种道德理论。我们的实验证明了所提框架在源自道德理论的数据集上的有效性。此外,我们展示了不同道德理论与现有道德性数据集之间的一致性。我们的分析揭示了现有资源(模型与数据集)在开发可解释道德判断系统方面的潜力与缺陷。

关键词

引用

@article{arxiv.2308.15399,
  title  = {Rethinking Machine Ethics -- Can LLMs Perform Moral Reasoning through the Lens of Moral Theories?},
  author = {Jingyan Zhou and Minda Hu and Junan Li and Xiaoying Zhang and Xixin Wu and Irwin King and Helen Meng},
  journal= {arXiv preprint arXiv:2308.15399},
  year   = {2024}
}