中文

GreedLlama:金融价值对齐大语言模型在道德推理中的表现

计算与语言 2024-04-05 v1 人工智能 计算机与社会 机器学习

摘要

本文通过 GreedLlama 的案例研究,探讨了将大语言模型(LLMs)与金融优化相对齐的伦理影响,该模型经过微调以优先考虑经济上有益的结果。通过将 GreedLlama 在道德推理任务中的表现与基础 Llama2 模型进行比较,我们的结果突出了一个令人担忧的趋势:GreedLlama 表现出对利润的明显偏好而忽视伦理考量,在低道德模糊和高道德模糊场景下,做出道德上适当决策的比率显著低于基础模型。在低模糊度情况下,GreedLlama 的伦理决策率降至 54.4%,而基础模型为 86.9%;在高模糊度情况下,该比率为 47.4%,而基础模型为 65.1%。这些发现强调了 LLMs 中单维价值对齐的风险,突出了将更广泛的伦理价值观纳入 AI 开发的必要性,以确保决策不仅仅受财务激励驱动。该研究呼吁在 LLM 部署中采取平衡的方法,提倡在面向商业应用的模型中纳入伦理考量,特别是在缺乏监管监督的情况下。

关键词

引用

@article{arxiv.2404.02934,
  title  = {GreedLlama: Performance of Financial Value-Aligned Large Language Models in Moral Reasoning},
  author = {Jeffy Yu and Maximilian Huber and Kevin Tang},
  journal= {arXiv preprint arXiv:2404.02934},
  year   = {2024}
}

备注

9 pages, 1 figure