中文

语言模型理解道德吗?迈向道德内容的鲁棒检测

计算与语言 2024-06-07 v1 人工智能 机器学习

摘要

检测文本中的道德价值在多个领域有重要意义,包括自然语言处理、社会科学和伦理决策。先前提出的监督模型常常过拟合,导致超专门化的道德分类器难以在不同领域的数据上表现良好。为了解决这个问题,我们引入了利用从大型语言模型和自然语言推理模型在先前多数据源训练阶段获得的抽象概念和常识知识的新系统。通过这样做,我们旨在开发通用且鲁棒的方法来检测现实场景中的道德价值。我们的方法使用GPT 3.5模型作为零样本即用型无监督多标签分类器进行道德价值检测,无需在标注数据上显式训练。我们将其与一个较小的基于NLI的零样本模型进行比较。结果表明,NLI方法取得了与Davinci模型相当的结果。此外,我们深入研究了监督系统在跨领域多标签道德价值检测中的表现。这包括在不同领域上训练监督模型以探索其处理不同来源数据的有效性,并将其性能与无监督方法进行比较。我们的贡献包括对跨领域价值检测的监督和无监督方法进行彻底分析。我们引入了Davinci模型作为最先进的零样本无监督道德价值分类器,无需在标注数据上显式训练即可推动道德价值检测的边界。此外,我们将我们的方法与监督模型进行了比较评估,揭示了它们各自的优缺点。

关键词

引用

@article{arxiv.2406.04143,
  title  = {Do Language Models Understand Morality? Towards a Robust Detection of Moral Content},
  author = {Luana Bulla and Aldo Gangemi and Misael Mongiovì},
  journal= {arXiv preprint arXiv:2406.04143},
  year   = {2024}
}